Google 发布三款新模型,网友差评不断,Gemini 4 预训练能否力挽狂澜?

发布时间:2026/9/10 21:11:38

Google 发布三款新模型,网友差评不断,Gemini 4 预训练能否力挽狂澜? 网友调侃与 Google 新模型发布据悉最近网友调侃称若从去年就开始用 Gemini感觉就像看着自家兄弟慢慢得了阿尔茨海默症。按理说公司发新模型通常会打脸此类调侃但刚刚 Google 一口气发布三个新模型后网友不仅没收回调侃反而笑得更大声。三个新模型分别是 3.6 Flash、3.5 Flash-Lite 和专搞网络安全的 3.5 Flash Cyber。官方博客措辞常见称其「更高效」「更聪明」「为大规模 AI agent 而生」然而实际体感却大相径庭。3.6 Flash主力模型的优势3.6 Flash 是此次的头牌官方定位为「主力」workhorse干活模型。3.5 Flash 于今年 5 月 I/O 大会发布此次是小版本迭代最大卖点是省 token。据 Artificial Analysis Index 数据3.6 Flash 比 3.5 Flash 少用 17% 的输出 token在 DeepSWE 等场景能省到 65%。官方还表示它跑多步任务时推理步数和工具调用更少即干同样的活废话、绕路更少账单更薄。其价格也下降了输入 1.5 美元/百万 token输出 7.5 美元/百万 token而上一代 3.5 Flash 输出为 9 美元。在基准测试方面官方给出了一系列数据。代码能力是重点DeepSWE 从 37% 提升到 49%官方称多余代码改动更少、执行循环更短生成代码更贴近生产环境要求机器学习研究方向的 MLE Bench 提升更明显从 49.7% 拉到 63.9%。计算机操作能力也有长进OSWorld-Verified 从 78.4% 升到 83%且「计算机操作」成了 Gemini API 和企业版的内置工具。知识工作方面GDPval-AA v2 从 1349 涨到 1421Hebbia、Harvey 等客户反馈它在文档解析等多模态任务上表现突出Figma、JetBrains 也出面背书。此外知识截止日期从 2025 年 1 月推进到 2026 年 3 月。安全方面3.6 Flash 采用升级版的 Frontier Safety 防护重点防范 CBRN 和网络攻击两类滥用抗越狱能力更强且尽量不误伤正常需求。3.5 Flash-Lite快且便宜的选择3.5 Flash-Lite 定位比 3.6 Flash 低一档主打「快」和「便宜」适用于高吞吐、低延迟任务如 agent 搜索、文档处理。它是 3.5 系列里最快的每秒吐 350 个 token价格实惠输入 0.3 美元、输出 2.5 美元每百万 token官方称质量比 3 月发布的 3.1 Flash-Lite 好很多。该模型有个灵活设计支持调「推理档位」低配活儿开最低档多步子任务调高思考档位电脑操作也做成了内置工具。与前代相比提升显著代码和 agent 任务的 Terminal-Bench 2.1 从 31% 提升到 54%长上下文的 GDM-MRCR v2 从 60.1% 提到 72.2%真实任务执行的 GDPval-AA v2 从 642 飙到 1140。有意思的是它在不少 agent 和代码任务上反超了 3 Flash如 SWE-Bench Pro54.2% vs 49.6%、OSWorld-Verified74.0% vs 65.1%可作为 3 Flash 的更快更强平替。官方还列举了其用法如从海量电商数据里抽产品特征等Ashler 等几家客户也夸赞其「速度、智能、成本三合一」。3.5 Flash Cyber专注网络安全3.5 Flash Cyber 画风突变专门用于找和修代码里的安全漏洞。Google 的逻辑是现在 AI 找漏洞速度比现有系统修漏洞速度快漏洞越堆越多所以用便宜高效的 Flash 来批量补锅。该模型在 3.5 Flash 基础上微调搭配自家的 CodeMender 工具CodeMender 里有多个 Flash Cyber agent 协同工作并汇总报告。在业内有名的 CyberGym 基准上官方称它达到第一梯队水平且比更大的模型更省 token。不过此模型暂时仅对「可信合作伙伴」限量开放走内测目的是给一线防守方争取时间修漏洞同时防止被人利用干坏事。旗舰 3.5 Pro 跳票与网友差评有疑问称发了一堆 Flash真正的旗舰 3.5 Pro 去哪了官方称「正在和合作伙伴测试准备好就上」但背后故事可能不那么体面。据彭博社等媒体报道3.5 Pro 的代码生成能力未达内部预期Google 6 月下旬更新训练数据补短板成绩仍无起色甚至有传闻称 Google 推翻原训练方案重训。Google AI 宣传委员 Logan Kilpatrick 跳过 3.5 Pro将预告重点放在 Gemini 4称已启动史上最雄心勃勃的 Gemini 4 预训练且进展令人兴奋但在「旗舰跳票」背景下有转移视线之嫌。第三方评测机构 Artificial Analysis 表示两个新模型单任务耗时减半、token 效率提升Flash-Lite 智能指数涨 11 分但 3.6 Flash 智能水平相比 3.5 Flash 基本原地踏步价格与能力不成正比。X 网友吐槽 3.6 Flash 得分与 3.5 Flash 一样不如 Meta Spark 1.1 等对手。网友 Angel 指出 Gemini 3.6 Flash 使用成本比 GPT-5.6 Sol medium 高智能程度却更低自砸「性价比」招牌。实测派也来补刀网友 Balder 称三个模型性能比 3.5 Flash 差测试问题包括基础解码毛病、中文选词离谱等还认为 Google 这么做是为把算力卖给 Anthropic。X 网友 Conor Dart 用 Google 自家的 Antigravity 跑 AI 生成游戏测试结果不理想直言等 Gemini 3.5/3.6 Pro。一边是官方漂亮账本一边是网友差评及模型背后的糟心事让人好奇 Google 是否点歪科技树只能靠 Flash 稳住场子。反正 Gemini 4 预训练已开始若再翻车阿尔茨海默的玩笑恐成谶语。
延伸阅读

更多相关文章

2026/9/9 17:20:35

欧盟 建材认证CPR 法规 (EU)305/2011 是什么

一、什么是 CPR?CPR Construction Products Regulation,《建筑产品法规》(EU) No 305/2011✅ 生效时间:2013-07-01 强制执行,替代旧 CPD 指令 89/106/EEC;✅ 适用区域:欧盟 27 国 欧洲经济区(…

2026/9/10 3:11:41

C++模板元编程与编译期计算:类型即算法

C模板系统在编译期执行计算的能力是C与其他主流语言之间最显著的区分之一。模板不仅是代码生成的工具,它本身是一个完整的编译期函数式语言——类型是它的数据,模板实例化是它的计算过程。理解模板元编程的工程价值,不在于写出晦涩的元代码&a…

2026/9/10 21:09:21

2026年AI开题报告工具评测与使用技巧

1. 2026年AI开题报告工具全景概览开题报告作为学术研究的起点,其质量直接影响后续科研工作的展开。传统开题报告撰写往往需要耗费研究者大量时间在文献综述、框架搭建和格式调整上。2026年涌现的这批AI工具,正在从根本上改变这一现状。我实测了市面上主流…

2026/9/10 21:09:21

知网AI检测规避:22款降重工具实测与学术论文优化方案

1. 项目背景与核心痛点 去年帮导师审阅研究生论文时发现一个现象:超过60%的投稿都存在AI生成痕迹被知网检测系统标红的情况。最典型的案例是某篇计算机专业的硕士论文,在"文献综述"章节被系统标注了78%的AI率,作者不得不延期答辩。…

2026/9/10 21:09:21

零售增长双引擎:新客活动与消费返券策略解析

1. 为什么"新客活动消费返券"是增长双引擎 在零售行业摸爬滚打多年,我发现最有效的增长策略往往不是那些花哨的营销噱头,而是能把基础玩法做到极致的组合拳。"新客活动消费返券"这个组合之所以能成为经典,是因为它同时击…

2026/9/10 21:09:21

grammY安全最佳实践:保护你的机器人和用户数据

grammY安全最佳实践:保护你的机器人和用户数据 Telegram机器人开发框架grammY为开发者提供了强大而灵活的工具来构建安全的机器人应用。作为最受欢迎的Telegram Bot框架之一,grammY不仅简化了机器人开发流程,还内置了多项安全特性来保护你的…

2026/9/10 16:39:38

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/10 11:16:38

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/9 16:31:09

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/10 0:00:55

目录对比去重实战:用哈希算法精准清理重复文件

我电脑里现在还有一块换了三次机的“数据墓地”硬盘,里面存着2016年以前所有旧笔记本的完整备份。平时不觉得有什么,直到前阵子想把它整理归档,发现同一个安装包、同一批照片、同一份论文草稿,在几个不同的备份目录里反复出现。更…

2026/9/10 0:00:55

Leaflet离线地图完整Demo合集:内网部署与坐标纠偏实战

简介:这是一份面向Web GIS开发者的LeafLet离线地图示例合集,帮助开发者快速掌握离线地图从搭建到交互的完整流程。压缩包共723个文件,大小14.06MB,以319个js脚本、175个html页面和29个css样式文件为主体,配合png/svg图…

2026/9/10 0:00:55

MATLAB读取Rinex 3.02观测文件:多系统GNSS数据解析实战

简介:基于MATLAB开发的Rinex3.02版观测文件(o文件)读取代码包,面向卫星定位导航方向的学习者与研究人员,用于解决新版观测文件的数据解析、历元提取与时间转换问题。压缩包共4个文件,包含两个m脚本、一个19…

2026/9/10 12:32:02

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/10 15:19:50

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/10 15:49:53

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码