A5站长网9月5日消息,谷歌又发新模型了,这是六周内的第三款Flash。Gemini 3.8 Flash打着“最聪明的主力模型”的旗号上线,最狠的是价格:输入每百万token 0.75美元、输出3.75美元,和3.7 Flash首发价完全一致,年底前不涨价。第三方评测给出一个直观对比:代码质量达到Claude Opus 5的级别,成本只要一个零头。

性能提升的思路很诚实——3.8 Flash就是干得更多。复杂任务上它会执行额外的推理步骤、反复调用工具直到把活干完。代价也明码标价:高努力档位下每个任务的token消耗比3.7 Flash高出约四成,等于谷歌把“多想”的成本转成了账单里的token数,开发者可以用可调的努力档位自己权衡。基准成绩相当能打:DeepSWE v1.1长周期软件工程测试拿到73.7%,几乎追平Opus 5的74.0%;HLE-Verified多步推理54.9%;金融与法律两个专业智能体基准双双超越前代和更大的前沿模型;Text Arena首秀排到第7,压过Claude Opus 5。
同期发布的还有一个更值得关注的变体:Gemini 3.8 Flash Cyber,谷歌迄今最强的网安模型,专门做漏洞发现和自动补丁。它不走公开API,只通过Fairwind计划交给政府、关键基础设施运营者和软件维护者这些“防御方”,用意很明显——攻击工具人人可用,防御工具必须看门。CyberGym基准拿到86.2%,二十种编程语言的内部测试检出率超七成,谷歌云安全团队用它不到两小时就挖出了一个原本可能漏掉的高危漏洞。
把镜头拉远,六周三连发透露的是谷歌的节奏焦虑和成本底气:Pro版旗舰迟迟不发,先用便宜大碗的Flash锁住开发者和企业工作流。DeepMind核心成员姚顺宇的发言把格局说破了——“对模型是一小步,对递归自我改进是一次飞跃”,模型用Agent循环打磨模型,发版速度只会越来越快。
A5创业网 版权所有