
一 | 7月21日,谷歌突然上线了两个新模型: Gemini 3.6 Flash和Gemini 3.5 Flash-Lite。 没有一点点防备,也没有一丝顾虑,它俩就这样出现在了Google AI Studio和Gemini的模型选择器里。 8月25日消息,近期,不少网发帖称铁路12306APP购票存在漏洞,用同一个人的身份证和护照,就能够在12306上买到同一趟列车的两张车票。 这两个模型,一个主打更强的代码和Agent能力,一个主打更低成本的大规模调用。 为验证网传说法,有媒体实测,在12306的APP操作过程中,系统允许同时勾选同一个人的身份证、护照两类身份信息,完成支付后就能成功拿到同一趟列车的两张相邻座位的车票。 而作为旗舰模型的Gemini 3.5Pro,千呼万唤依然……出不来。 按照此前的计划,3.5 Pro本应在6月份上线,现在7月都过一大半了,这款被寄予厚望的模型仍然没有正式亮相。

二 | 代表旗舰实力的答卷迟迟不交,谷歌先拿出两张“草稿纸”,是个什么意思? 01 3.6 Flash:比上一代便宜,不比上一代聪明 谷歌表示,相比上一代Flash模型,Gemini 3.6 Flash进一步提升了编码、推理和工具调用表现,同时通过减少输出token降低运行成本。

三 | Gemini 3.6 Flash的定位是一个面向真实生产环境的高效模型,或者更直白一点,为Agent服务。

四 | 按照铁路相关规则,要想同时占用两个座位,两张车票都需要完成检票流程。有网友提出了操作方式:持身份证通过闸机进站,登上列车之后,再请乘务员用人工核验的方式完成护照对应的车票检票,以此就能保住第二个座位。

五 | 在Agent时代,一次任务可能需要几十轮模型调用,这意味着模型不仅要聪明,还必须足够快、足够便宜。 针对这一现象,12306客服称,因为身份证和护照分属不同证件体系,两者信息尚未互通,所以会出现同一人凭两类证件同时购得同车次多张车票的情况。 Google此前已经在Gemini 3.5 Flash上强化了这条路线。根据官方API文档,Gemini 3.5 Flash支持100万token的长上下文,可以一次处理大量信息,同时支持代码执行、调用外部工具、搜索文件等能力,能够完成更复杂、更长时间的任务。不过官方并不提倡旅客采用这种方式出行。 一方面,该做法需要个人承担两份车票费用,会带来不必要的经济支出;另一方面,铁路座位属于公共出行资源,一人占用两个座位,会造成席位的浪费。 Gemini 3.6 Flash延续了这条路线,它追求的并不是单次回答的质量,是一个“能够承担得起每日真实工作”的位置。

六 | Gemini 3.6 Flash的定价如下: 输入:1.50 美元/百万 token 输出:7.50 美元/百万 token 相比此前Gemini 3.5 Flash每百万token输入1.5美元、输出9美元的价格,输入成本没有变化,但输出成本进一步下降。 对于需要大量调用AI的企业来说,这种成本变化可能比benchmark上的几个百分点提升更加重要。

七 | 目前,客服已经把网友反馈的这一情况登记上报。 另外,谷歌展示的一项内部测试显示,在完成同一任务时,Gemini 3.6 Flash相比3.5 Flash减少了55.8%的token消耗,同时将任务评分从85分提升到了100分。

八 | 铁路部门也提醒广大乘客,应当理性购票,不要刻意使用该方式抢占座位,共同维护铁路出行资源公平合理使用。

九 | 当然,这只是谷歌自己的测试结果,只能说明Google希望展示的方向: 新模型不仅更省,而且能够用更少的计算完成同样甚至更好的任务。

十 | 谷歌表示,新模型能够减少无效代码修改和重复执行过程。 在测试AI操作电脑能力的OSWorld-Verified评测中,Gemini 3.6 Flash得分83%,超过3.5 Flash的78.4%。

十一 | 而在面向机器学习任务的MLE Bench中,Gemini 3.6 Flash得分63.9%,相比上一代的49.7%也有明显提升。

十二 | 不过,上述数据更多说明Gemini 3.6 Flash相比上一代有所进步。 如果放到当前大模型竞争中横向比较,Google选择的对手是GPT-5.6 Luna、Grok 4.5和Claude Sonnet 5(这里也可以看出这个产品的定位)。 从结果来看,Gemini 3.6 Flash并没有全面领先,GPT和Claude的模型在复杂软件工程和知识工作任务上仍然保持优势。 但这其实也是Flash系列存在的意义: 它不一定要成为最强模型,只需要在明显低于旗舰模型成本的情况下,提供够用的能力。 官方测评之外,根据Artificial Analysis的发布前测试,Gemini 3.6 Flash在Intelligence Index上拿到了50分,与Gemini 3.5 Flash持平。 这意味着,如果只看模型综合“智力”,Gemini 3.6 Flash并没有什么升级。 但是呢,它的速度又很好地弥补了这一点。 Artificial Analysis还统计了模型完成Intelligence Index任务所需的平均时间。

十三 | 结果显示,Gemini 3.6 Flash每项任务平均耗时约1.3分钟,相比上一代3.5 Flash的约2.7分钟,减少了一半。 与此同时,Gemini 3.5 Flash-Lite的任务完成时间也从上一代3.1 Flash-Lite的约1.6分钟,下降到约0.6分钟。

十四 | 总的来说,Gemini 3.6 Flash的升级方向其实是效率——更少的token消耗,更低的运行成本,以及更适合长期运行的Agent能力。 对于习惯使用Gemini 3.5 Flash的用户来说,确实是非常不错的升级。 02 3.5 Flash-Lite:更快,但没有上一代便宜 然后再来看另一个模型Gemini 3.5 Flash-Lite。 顾名思义,Flash-Lite是Flash系列中更轻量的版本,相比Flash,它牺牲了一部分能力上限,换取了更低的成本和更快的速度。

十五 | 就像前面提到的那样,Gemini 3.5 Flash-Lite的任务完成时间从上一代3.1 Flash-Lite的约1.6分钟,下降到了约0.6分钟。 3.5 Flash-Lite也是3.5系列中速度最快的型号,根据Artificial Analysis测试数据,其生成速度达到约350 token/秒,已经属于当前主流大模型中的高速水平。

十六 | Gemini 3.5 Flash-Lite的定价如下: 输入:0.30 美元/百万 token 输出:2.50 美元/百万 token 相比Gemini 3.6 Flash,输入价格约为1/5,输出价格约为1/3。不过,与上一代Gemini 3.1 Flash-Lite相比,新模型并没有进一步降价。 虽然Gemini 3.5 Flash-Lite由于能力提升,可以通过减少输出量降低部分成本,但综合起来,还是很难抵消单价上的成本增加。

十七 | 根据官方文档,相比上一代Gemini 3.1 Flash-Lite,新模型在不同思考等级(thinking levels)下都有明显提升。开发者可以根据任务需求调整模型的思考深度。

十八 | 此外,Gemini 3.5 Flash-Lite还内置了Computer Use能力,可以帮助Agent更可靠地操作电脑环境,完成跨应用任务。 在具体测试中,Gemini 3.5 Flash-Lite相比上一代模型也有明显提升:在Terminal-Bench 2.1编程Agent测试中,成绩从31%提升到54%;在测试长上下文理解能力的GDM-MRCR v2中,从60.1%提升到72.2%;在更贴近真实工作场景的GDPval-AA v2任务执行测试中,从642提升到1140。

十九 | 值得注意的是,在一些Agent和代码相关测试中,Gemini 3.5 Flash-Lite甚至超过了上一代更高定位的Gemini 3 Flash模型。 例如,在SWE-Bench Pro软件工程测试中,Gemini 3.5 Flash-Lite得分54.2%,高于Gemini 3 Flash的49.6%;在测试AI操作电脑能力的OSWorld-Verified中,Gemini 3.5 Flash-Lite也以74.0%的成绩超过Gemini 3 Flash的65.1%。

| 这意味着,随着模型能力不断提升,过去需要更大模型才能完成的部分Agent任务,正在逐渐下沉到更便宜、更快速的模型。 顺便一提,除了前两个面向普通用户的通用模型,谷歌还推出了Gemini 3.5 Flash Cyber。 它主要针对网络安全场景。

| 根据官方文档,在CodeMender系统中,多个Gemini 3.5 Flash Cyber Agent可以协同工作,分别完成不同分析任务,并最终汇总成一份完整报告。在网络安全基准测试CyberGym中,Flash Cyber也达到了接近前沿模型的表现。 该模型目前不会公开提供,仅通过CodeMender平台向政府和可信合作伙伴开放。 03 3.5 Pro:谷歌迟迟交不出的旗舰答卷 如果说Gemini 3.6 Flash和Gemini 3.5 Flash-Lite还可以看作是谷歌对AI规模化应用的判断,那么Gemini 3.5 Pro则代表着谷歌的模型上限。 但问题在于:这份答卷,到现在还没有交出来。 5月I/O的时候,谷歌表示Gemini 3.5 Pro将在“接下来一个月左右”推出,也就是预计在今年6月上线。现在7月都过了一大半了。 据彭博社7月16日报道,Gemini 3.5 Pro的发布时间已经落后原计划数月。

| 谷歌正在继续优化模型能力,尤其是编码表现,希望达到内部设定的目标。

| 路透社最新的报道则显示,截至目前,谷歌仍未公布具体上线时间,只表示该模型正在与合作伙伴测试,并将“很快”推出;另有新闻稿透露,Gemini 4的训练工作已经开始了。 而我们都知道,“很快”就是不确定的意思。 Gemini 1.0发布时就曾因演示争议受到质疑;Gemini 1.5 Pro凭借百万token上下文短暂扳回局面,但随后Claude和GPT系列快速追赶;直到Gemini 3系列发布,谷歌才重新获得“回到前沿竞争”的评价。 如今Gemini 3.5 Pro再次延期,市场关注的已经不只是一个模型什么时候上线,还有谷歌到底能否保持旗舰模型的竞争节奏问题。

| 何况谷歌透露出的编码表现不及预期,并不是什么容易解决的小问题。 随着Agent开始进入企业工作流,代码能力的重要性迅速提升。

| 一个模型能否理解复杂项目、修改真实代码、完成多步骤开发任务,已经成为衡量它是否具备实际生产价值的重要指标。 路透社指出,华尔街正在等待Gemini 3.5 Pro,因为它将成为判断Google DeepMind是否能够跟上OpenAI和Anthropic的重要指标。 当然,谷歌并不是没有动作,这次推出的几个模型,恰说明谷歌正在强化另一条路线:让AI变得更便宜、更容易规模化。 谷歌CEO Sundar Pichai近期也多次强调成本优势,并表示企业如果将大部分AI工作负载迁移到Gemini模型,可以每年节省超过10亿美元。 但问题在于,市场在期待一份证明谷歌模型实力的“答卷”,谷歌交出的却是两张关于效率和成本的“草稿纸”——很难不让人觉得,谷歌在用Flash系列填补Pro延迟留下的空档。 有意思的是,在Gemini 3.5 Pro延期的同时,AI竞争格局正在发生变化。

| 过去,人们讨论AI领先者,主要关注海外“御三家”:OpenAI、Anthropic和Google DeepMind。 但最近,GLM-5.2、Kimi K3等国产模型也开始进入前沿竞争,并引发了大量讨论。 前沿模型的追赶速度正在加快,也让谷歌的问题变得更加紧迫,它当然可以继续大力推出Flash模型,但前提是它的旗舰模型足够给力——只要硬实力足够,自有大儒为他辩经。 如果谷歌最终推出一个真正领先的旗舰模型,那么Flash路线会成为完整体系的一部分:Pro负责突破能力上限;Flash负责规模化应用。 但如果Gemini 3.5 Pro持续落后,市场很可能会继续追问:谷歌拥有最强AI研究资源,为什么却无法稳定跑赢竞争对手? 在Alphabet本周举行第二季度财报电话会议时,人们很可能会进一步询问有关Gemini 3.5 Pro的更多细节。(作者:袁心玥)。
Current article:http://aw9fhf5.focuolequzenkedenchaoruaxing.pics/list_vx7t/hxyd.html
Published on:18:01:13
1
曝《GTA6》昼夜循环足有144分钟!是前作的3倍2
一「指」爆红:斩获千万流量,这个WNBA球员只用了22秒3
中国第16次北冰洋考察|“雪龙2”号开展冰站作业4
在小红书个人卖平台买S925银吸铁石可吸平台拒处理还包庇5
广东今年前7月生产供给增长较快 新动能成长壮大,广东今年前7月生产供给增长较快 新动能成长壮大6
迪格雷戈里奥:感受到伯恩茅斯非常希望我加盟,很荣幸能征战英超7
千问办公内测:Agent办公时代,企业如何接住红利?8
Chinese students take over kitchen during summer holiday9
国家体育总局体育基金管理中心副主任罗建彬被查10
기업 100곳, 청년 1000명 몰렸다…에기평, 일자리 박람회11
第十轮小胜上海海港 武汉三镇不败战绩领跑中超12
“中国脆李之乡”释产业红利 变“单打冠军”为“团体冠军”,“中国脆李之乡”释产业红利 变“单打冠军”为“团体冠军”13
划水!亚历山大今天仅得15分 他上次得分低于20还是去年10月14
注意!奥克兰西区可能发生大规模斗殴,学生们尽量避开New Lynn车站!15
How China's new environmental code translates national ecological goals into everyday rules1
वाराणसी में नाबालिग मां को चंद घंटे में अस्पताल से लौटाने की जांच करेगी चार सदस्यीय टीम, पुलिस ने बढ़ाई सुरक्षा2
辽宁省五方面发力建设整合型医疗卫生服务体系3
「庭や玄関先が華やか…」「今から植えられる」春の花6選!早春に苗を植えるコツ&お手入れ方法も4
ST云城:聘任杨恒担任公司副总经理5
Suifenhe vehicle exports to Russia more than double6
河村勇辉秀完美肌肉线条!辻直人:身体素质太强了,1.72米能撞飞吕俊锡7
《金刚狼》限定PS5配件被黄牛抢光了 二手严重溢价!8
海护·安全在线|安全“童”行9
活力中国调研行|好客山东“上新”了10
接英雄回家!第九批在韩中国人民志愿军烈士遗骸16日回国11
德安东尼回忆湖人执教往事:愿意接手是因为纳什12
明泰铝业:近期上调部分产品加工费 上调区间300—500元每吨13
华为Mate 50 Pro第二,iPhone 14 Pro Max第三_系列_市场14
新西兰最危险十字路口排行榜:奥克兰杀人路口在这里!15
《哪吒2》红利消退!光线传媒上半年净利同比暴跌98.5% 经营现金流转负Copyright @ 2016-2017 我的网站 版权所有