6.4
深览指数
科技腾讯新闻··AI 生成
谷歌连发三款“Lite、Flash”模型,但最强Pro再次缺席
谷歌发布Gemini 3.6 Flash、3.5 Flash-Lite与3.5 Flash Cyber三款模型,主攻效率与垂直场景,旗舰Pro模型再次跳票。文章核心观点是谷歌当前策略转向性价比竞争,而非追求旗舰基准测试排名。这既回应了企业对AI投入产出比的现实关切,也暴露了其在前沿模型竞赛中可能的技术瓶颈。适合关注AI产业动态、模型选型与成本优化的从业者阅读。原文 ↗
核心观点
- ▍谷歌当前模型策略从追求旗舰基准排名转向建立效率优势,通过降低token消耗、提升速度来满足企业对AI投入产出比的现实需求。
- ▍旗舰模型Gemini 3.5 Pro再次推迟发布,谷歌已启动下一代Gemini 4的预训练,暗示其研发管线可能面临内部性能目标与交付节奏的冲突。
- 01Gemini 3.6 Flash在DeepSWE基准测试中token消耗减少65%,定价为每百万输出token 7.50美元,低于3.5 Flash的9美元。
- 02Gemini 3.5 Flash-Lite生成速度达每秒350个输出token,是上一代3.1 Flash-Lite的两倍,定价每百万输出token 2.50美元,瞄准高吞吐量业务场景。
- 03Gemini 3.5 Flash Cyber基于3.5 Flash微调,用于网络安全漏洞检测,在CyberGym基准测试中达前沿水平,但仅向政府和受信合作伙伴开放。
- 04谷歌CEO皮查伊曾表示,有的公司5月份就花完了全年token预算,暗示混合使用Flash模型可节省大量资金。
- 05彭博社报道称,谷歌因难以达到内部性能目标,在推出3.5 Pro方面面临内部延迟。
- 06截至发布当天,在Artificial Analysis的数学和推理等综合基准测试中,谷歌没有一款模型进入前十名。
反方 / 局限
- — 开发者社区反馈显示,Gemini 3.6 Flash在实际编码任务中表现不佳,有用户评价其输出质量“一个本地4B模型都比它做得好”。
- — 有评论指出,资本规模远小于谷歌的实验室(如月之暗面)打造的Kimi K3和GLM 5.2等模型,在编码基准上表现优于Gemini 3.6 Flash。
Gemini 3.6 FlashGemini 3.5 Flash-LiteGemini 3.5 Flash CyberGemini 3.5 ProGemini 4DeepMindArtificial AnalysisOpenAIAnthropic月之暗面桑达尔·皮查伊图尔西·多希洛根·基尔帕特里克彭博社CodeMender
13 分钟 · 4 卡片 · 11 资料
读原文 →