夜间模式 切换到宽版

 找回密码
 注册

QQ登录

只需一步,快速开始

搜索
查看: 110|回复: 0

[科技新闻] Gemini 发了 3 款新模型,表现拉了……

[复制链接]
  • 打卡等级:功行圆满
  • 打卡总天数:834
发表于 2026-7-24 15:44 | 显示全部楼层 |阅读模式

马上注册,查看更多内容,享用更多功能,让你轻松玩转社区。

您需要 登录 才可以下载或查看,没有账号?注册

×
7 月 21 日,谷歌新的大模型终于出炉了。
不过没有发布会,没有直播,官方悄咪咪发了个推,上了个页面就完事了。
1.webp

是不是感觉有点敷衍,因为发布的不是大家盼了好久的 Gemini 3.5 Pro,而是 3 款轻量模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyber。
不是……明明 5 月 I/O 开发者大会上,亲口承诺 6 月就上旗舰 Pro 模型,这都7 月末了,连个影儿都没有,也是 AI 纪元的新型“大记忆消失术”了!
事已至此,就看看这 3 款模型表现到底咋样呗。
首先是这次主推的 3.6 Flash,谷歌宣传主打同成本下效果更强。
2.webp

官方给出数据,3.6 Flash 的输出 Token 消耗比前代产品降低 18%,虽说不是特别明显的提升,但这意味着用它干活,要比以前好用,至少没那么啰嗦,用最快的路径完成交代它的任务,这不省下的就是赚到的。
顺带输出单价降了,从 9 美元砍到 7.5 美元/百万 Token,反正怎么省钱怎么来。
代码基准测试上,DeepSWE 从 37% 涨到 49%,毕竟代码生成的需求是急剧增长的,这方面的能力提升和贴近现实生产工程的场景需求,无疑是优化重点。
3.webp

单看纸面数据,像是一次均衡升级,但实测后不对劲了。
根据 Artificial Analysis 测试的数据,3.6 Flash 综合智能评分和上代 3.5 Flash 完全持平,本质上只优化了推理链路,模型底层理解能力没有提升,虽然完成任务消耗的算力成本更低,但解决复杂问题的上限丝毫没有上涨。
4.webp

翻译翻译就是,变便宜了,但智力没涨……
X 上也有用户实际分享了不同应用场景下,3.6 Flash 的表现,只能说一言难尽了……
5.webp

说白了,这波 Gemini 升级优化的不是模型智商,是推理效率。它学会了少说废话、少走弯路,完成同样的简单任务,消耗的算力更少、更省钱。
但要是指望它能搞定更复杂的事,比如长链条代码重构、复杂多模态创作、深度逻辑推演,抱歉,跟以前一样拉胯。
可不谈智能的情况下谈省钱,这妥妥的伪命题啊……
省 Token 是真省,笨也是真笨。简单批量任务用着划算,一旦涉及复杂逻辑,就得反复提示、多轮修正,看似单次便宜了,总调用成本反而更高,离了大谱!
另一款 3.5 Flash-Lite,定位更极致:便宜,快,吞吐量大。
6.webp

价格不用问,量大管饱,输入 0.3 美元、输出 2.5 美元/百万 Token,算是直接干到地板价了。
代价也很明显,模型能力大幅裁剪,上下文深度、逻辑复杂度都砍了一刀,更适合干批量摘要、简单检索这种流水线粗活。
不过,总比 3.1 Flash-Lite 聪明一些。
7.webp

实话说,个人觉得这就是专门给海量标准化任务准备的“算力耗材”,跟智能两个字基本不沾边。
至于 3.5 Flash Cyber,这款模型其实和普通用户没啥关系。
8.webp

它专为代码漏洞扫描微调,仅对政府、可信企业内测开放,料想谷歌也是在 AI 安全防范这套叙事里比较严谨,生怕这款模型被用来挖掘攻击漏洞,所以严格锁死准入门槛。
看下来,3.5 Flash Cyber 更像是补足安全赛道的点缀产品,谈不上核心竞争力,也撑不起大众口碑。
至于表现究竟如何?普通用户测不到,在比较知名的 CyberGym 基准上,官方表示 3.5 Flash Cyber 属于具有竞争力的水平,咱就当看个热闹吧。
9.webp

所以,说了这么多,其实大家最关心的问题是:还能等到 Gemini 3.5 Pro 吗?
据彭博社等多家科技媒体的报道,3.5 Pro 缺陷的原因大概率是因为其代码生成与智能体规划能力不达标。
10.webp

在企业付费场景里,代码、自主 Agent 是商业价值颇高的赛道,客户愿意为能独立完成工程重构、自动化运维的模型支付高额服务费。
据说,在谷歌多轮内部测试中,3.5 Pro 在代码基准、长程工具调用上始终达不到谷歌内部及格线,即便迭代多版训练数据集,提升幅度依旧远低于预期,最终只能跳票。
这么一看,谷歌面临的状况还蛮棘手的,高端客户一直在流失,自家旗舰又迟迟交不出货,除了拿低价 Flash 模型守着中低端盘子,好像也没别的办法。
谷歌这边,没准也是因为关注到舆论,大家都在抱怨旗舰跳票,官方工作人员就顺势放了个消息:Gemini 4 已经启动史上最大规模预训练。
11.webp

这……谷歌你这浓眉大眼的,怎么也学会画饼了!
当下的产品拿不出手,就用下一代的远期预期安抚资本市场和用户。
只能说,这种操作硅谷大厂玩得轻车熟路,但远水救不了近火,而且用多了,只会越来越消耗大家的信任。
12.webp

按道理说,谷歌做 AI 大模型,不应该拉垮。
它是 Transformer 的诞生地,是深度学习时代的王者,DeepMind 做出过 AlphaGo 这种惊艳全世界的成果。
没人会怀疑谷歌的技术底蕴,可一手好牌打成今天这样,旗舰跳票、人才流失、市场份额被蚕食,确实让人唏嘘。
此前,网上流传 Anthropic 创始人说 Kimi 蒸馏了他们尚未开发完成的模型,成为大家的笑谈。
13.webp

实在不行,不如让 Gemini 直接蒸馏 Kimi K3 吧,这样起码模型表现更好些。
毕竟 AI 时代,没有永远的王者,菜就是原罪。
14.webp

深耕十余年的科技媒体,近千万读者的兴趣栖息地,每日跟踪科技、数码、AI、新能源、热点等重磅内容,专注于每日为大家提供更新鲜、前沿、专业、发展的热点科技报道,欢迎关注@科技狐!
您需要登录后才可以回帖 登录 | 注册

本版积分规则

文字版| 手机版| 小黑屋| RSS| 举报不良信息| 精睿论坛 ( 鄂ICP备07005250号-1 )

GMT+8, 2026-7-25 00:43 , Processed in 0.123250 second(s), 5 queries , Gzip On, Redis On.

Powered by VC52.CN

快速回复 返回顶部 返回列表