首页/新闻资讯/正文详情

Google 连发三个新 Gemini 模型,官方宣传与网友差评落差大,Gemini 4 能救场吗?

发布时间:2026/9/29 21:38:00 来源:云帆数科 栏目:资讯中心
Google 连发三个新 Gemini 模型,官方宣传与网友差评落差大,Gemini 4 能救场吗?
主角登场3.6 Flash 到底强在哪如果你从去年就开始用 Gemini会感觉像看着自家兄弟得阿尔茨海默症这是网友调侃。Google 发三个新模型后网友反应更大。三个模型是 3.6 Flash、3.5 Flash - Lite、3.5 Flash Cyber官方措辞熟悉但实际体验不同。先说 3.6 Flash官方定位是“主力”干活模型。3.5 Flash 今年 5 月发布此次小迭代卖点是省 token。按数据3.6 Flash 比 3.5 Flash 少用 17%输出 token特定场景省 65%。跑多步任务时推理步数和工具调用少。价格下降输入 1.5 美元/百万 token输出 7.5 美元/百万 token上一代输出是 9 美元。基准测试中代码能力提升DeepSWE 从 37%到 49%MLE Bench 从 49.7%到 63.9%计算机操作能力 OSWorld - Verified 从 78.4%到 83%“计算机操作”成内置工具。知识工作方面GDPval - AA v2 从 1349 到 1421客户反馈多模态任务表现好有企业背书。知识截止日期从 2025 年 1 月到 2026 年 3 月安全上有升级版防护。以小博大便宜大碗的 3.5 Flash - Lite 也能更换推理档位了3.5 Flash - Lite 定位低于 3.6 Flash主打“快”和“便宜”适合高吞吐、低延迟任务。它是 3.5 系列最快的每秒吐 350 个 token价格便宜。质量比 3 月的 3.1 Flash - Lite 好。支持调“推理档位”电脑操作成内置工具。跟前代比提升明显在不少任务上反超 3 Flash官方举例多种用法有客户夸赞。3.5 Flash Cyber专门修补代码安全漏洞3.5 Flash Cyber 专门找和修代码安全漏洞。因 AI 找漏洞快Google 用 Flash 补漏洞。它在 3.5 Flash 基础微调搭配 CodeMender 工具在业内基准上达第一梯队且省 token。只对“可信合作伙伴”限量内测防漏洞被利用。说好的 3.5 Pro 呢官方称 3.5 Pro 正和合作伙伴测试。但据报道其代码生成能力未达预期更新数据后仍无起色甚至可能重训。宣传委员跳过 3.5 Pro 预告 Gemini 4有转移视线之嫌。网友并不买账第三方评测机构称新模型有提升但 3.6 Flash 智能水平基本原地踏步价格和能力不匹配。网友吐槽 3.6 Flash 不如对手性价比低。OpenAI 因用户达 1000 万给付费用户重置额度。实测网友指出新模型性能差有诸多问题。一边是官方宣传一边是网友差评让人怀疑 Google 是否点歪科技树Gemini 4 若再翻车调侃或成真。

相关推荐

2026智能计算应用大会 | 数字认证与海光信息、麒麟软件联合发布一体化计算平台方案
2026智能计算应用大会 | 数字认证与海光信息、麒麟软件联合发布一体化计算平台方案

日前,以“智算无界,范式跃迁”为主题的光合组织2026智能计算应用大会在郑州隆重启幕。6000余位参会嘉宾围绕智能计算应用与发展范式、AI基础设施创新、算力底座体系建设等议题展开探讨交流,探索国产AI算力从基础设施搭建向规模化场景应用转化… · 2026/8/26 9:02:56

桌面Agent越权操作实录:3层沙箱规则守住我的工作目录
桌面Agent越权操作实录:3层沙箱规则守住我的工作目录

当Agent开始乱删我的文件:从事故到系统防护的完整实践 上周五下班前,我让本地运行的办公Agent帮我整理季度报告素材。结果回来发现它不仅删错了未归档的原始数据,还把整个/tmp目录清空了——这是典型的沙箱逃逸问题。在测试有道Lobster这类桌… · 2026/8/6 3:47:12

轻松上手 Vibe Coding:如何与 AI 协作写出靠谱代码
轻松上手 Vibe Coding:如何与 AI 协作写出靠谱代码

轻松上手 Vibe Coding:如何与 AI 协作写出靠谱代码 前言1. Vibe Coding 解决的不是写代码,而是协作失控2. 第一步:规划就是一切2.1 先规划,再编码2.2 规划要写到什么程度 3. 用 React Todo 看懂规划如何落地4. 第二步:… · 2026/9/11 22:11:40

Spingboot启动预热的实现
Spingboot启动预热的实现

启动预热的适用场景启动预热适合以下情况:数据主要来自第三方接口,无法直接从本地数据库读取。第三方接口响应较慢,首次访问容易超时。一个页面需要调用多个第三方接口或逐项查询。数据读取频繁,但变化不频繁。希望服务启动后&… · 2026/9/29 6:52:37

Understanding Driving Risks using Large Language Models: Toward Elderly Driver Assessment
Understanding Driving Risks using Large Language Models: Toward Elderly Driver Assessment

文章主要内容总结 本文研究了多模态大语言模型(具体为ChatGPT-4o)利用静态行车记录仪图像进行类人交通场景解读的潜力,重点聚焦与老年司机评估相关的三项任务:交通密度评估、交叉口可见性评估和停车标志识别。这些任务需上下文推理而非简单目标检测。研究采用零样本、少样… · 2026/9/29 12:28:25

Leveraging Large Language Models for Classifying App Users‘ Feedback
Leveraging Large Language Models for Classifying App Users‘ Feedback

文章主要内容总结 本文聚焦于利用大型语言模型(LLMs)解决应用用户反馈分类的挑战,传统方法依赖有监督机器学习,但受限于标注数据集的规模和质量。研究通过三个核心实验评估了4种先进LLMs(GPT-3.5-Turbo、GPT-4o、Flan-T5、Llama3-70b)的性能: LLMs在用户反馈分类中的基… · 2026/9/29 13:54:46

Using Large Language Models for Legal Decision-Making in Austrian Value-Added Tax Law: An Experim...
Using Large Language Models for Legal Decision-Making in Austrian Value-Added Tax Law: An Experim...

文章主要内容总结 本文通过实验评估了大型语言模型(LLMs)在奥地利及欧盟增值税(VAT)法框架下辅助法律决策的能力。研究聚焦于两种提升LLM性能的方法——微调(fine-tuning)和检索增强生成(RAG),并在两类案例中进行验证:一是权威教科书案例,二是税务咨询公司的真实案… · 2026/9/29 13:54:48

学Java别走弯路,这5个方向最吃香
学Java别走弯路,这5个方向最吃香

学Java的人很多,但学明白的人不多。有人学了半年还在写控制台程序,有人一年就能独当一面。差别不在天赋,而在方向。Java生态太庞大了,什么都学等于什么都没学。选对方向,事半功倍。今天盘点当前最吃香的5个Java方向&am… · 2026/9/29 4:13:53

AlphaAgents: Large Language Model based Multi-Agents for Equity Portfolio Constructions
AlphaAgents: Large Language Model based Multi-Agents for Equity Portfolio Constructions

AlphaAgents相关总结与翻译 一、文章主要内容总结 (一)研究背景与问题 传统股票投资组合管理依赖人类分析师处理海量信息(如财务披露、财报、市场新闻等),存在信息处理效率低、易受认知偏差(如损失厌恶、过度自信)影响的问题,可能错失投资收益机会。尽管AI在数据处理… · 2026/9/29 13:54:44

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/29 0:45:26

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/29 13:54:52

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/29 8:55:58

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码