首页/新闻资讯/正文详情

GPT-6 Sol 第三方实测:智力指数持平、编码代理 57 分,幻觉率从 92% 砍到 60% 的代价是什么

发布时间:2026/9/24 19:41:38 来源:云帆数科 栏目:资讯中心
GPT-6 Sol 第三方实测:智力指数持平、编码代理 57 分,幻觉率从 92% 砍到 60% 的代价是什么
GPT-6 Sol 发布当天OpenAI 给出的口径是错误约减半、价格减半。一天后Artificial Analysis 的独立评测出来了——这份评测的价值在于它既确认了 OpenAI 没吹的部分也把没说的代价摆了出来。先给结论Sol 是一次很扎实的发布但它最引人注目的幻觉率下降有一部分是靠少回答实现的。一、第三方确认的部分GPT-6 Sol (max) vs GPT-5.6 Sol (max)Artificial Analysis 实测定价$2/$10较前代减半智力指数与前代持平编码代理指数57上升 2 分Terminal-Bench 4.043% vs 37%SWE-Atlas-QnA58% vs 54%单任务成本智力指数$1.06 vs $1.99约省一半单任务成本编码代理$2.99约省一半位于 Pareto 前沿智力指数持平、编码代理上升 2 分、成本减半——这三行连起来读才是这次发布的准确定义不是能力跃迁是把同等能力便宜一半地重新上市。AA 的判断是 Sol 占据了 Coding Agent 指数 vs 单任务成本的 Pareto 前沿这个说法我认同。还有一个容易被忽略的细节Sol 每任务多用了输出 token31k vs 29k。也就是说成本下降完全来自单价不是来自它变得更省 token。这一点和 Opus 5.5省 token 又降价的路线恰好相反。二、幻觉率 92% → 60%好事但要看清机制AA-Omniscience知识与幻觉基准的数据最扎眼AA-Omniscience 幻觉变化幻觉率92% → 60%答题尝试率99% → 83%错误答案数减少约四分之一答题准确率59% → 54%反而降 5 分AA-Omniscience 指数22 → 27把这五行放在一起机制就清楚了Sol 幻觉变少主要不是因为它知道得更多而是因为它更敢说不知道。尝试率从 99% 掉到 83%——那 16% 不再硬编的题原本大部分是幻觉重灾区。我对这件事的看法是正面的但要纠正一个流行误读这不是准确性提升 32 个点而是不确定性处理变好了。在 QA 型产品里这是巨大进步但在知识密集型工作里那 5 分的准确率下降意味着你遇到的自信的错误比例可能没怎么变——只是总量少了。Luna 的同款数据也顺手列一下幻觉率 93% → 77%准确率 44% 基本持平Omniscience 指数从 -10是的负分到 1。三、第三方指出的两处退步这次评测最有价值的信息其实是退步项OpenAI 的发布材料里没有提GDPval-AA v2.1覆盖 44 个职业的经济价值任务基准Sol 掉了约 100 EloLuna 掉约 75AA-Briefcase v1.1跨数周的知识工作项目、数千输入文件的私有评测Luna 掉约 45 EloSol 持平。AA 团队人工检查了数百个输出后给出的归因是交付物变短了展示质量下降更常漏掉评分项要求的要素。这个发现对实际选型很重要。如果你的场景是生成报告、方案、长文档这类知识交付物Sol 的退步是真实存在的如果只是编码和 Agent 调用则不受影响。这也是我一直建议用自己的评测集而不是榜单做决策的原因——榜单的均值会把这些结构性差异抹平。四、缓存重设计被低估的另一半这次降价 OpenAI 归因于缓存与推理改进其中缓存部分有实料改变 reasoning effort 或可用工具不再使已缓存上下文失效——这对 Agent 是关键以前调整工具集就要重算整个前缀缓存读取享受 90% 折扣与 5.6 系列一致写入溢价 25%OpenAI 披露 GitHub 上 billions 级请求的数据需要新鲜处理的 prompt token 份额下降超过 50%直接反映在 Copilot 的延迟与成本上。配合前面说的多花 2k 输出 token整个成本模型的正确理解是OpenAI 把钱从重复读前缀上省下来贴到多写输出上去了。长对话、Agent 场景受益最大单轮短问答场景感受会弱一些。五、我的判断以及保留意见判断Sol 是防守反击型发布能力不冒进、价格直接砍半目标是守住中间价位段。考虑到 Anthropic 的 Opus 5.5 比 OpenAI 的发布早 90 分钟这个时间点本身就是回应幻觉治理路线值得行业注意。少回答换少犯错是比全部硬答更诚实的取舍预计会成为后续模型的普遍选择——但对下游产品意味着要做拒答兜底设计GDPval 的退步是选型分水岭。编码/Agent 负载选 Sol 很划算长文档交付类负载建议等一等或保留前代。保留意见OpenAI 内部事实性评测错误减半、接近 Astra 级可靠性是基于自有评测、以自家前代为参照的口径跨实验室对比仍需等独立数据AA 的 GDPval / AA-Briefcase 退步结论基于其私有 harness 与人工抽检样本与方法未完全公开方向可信、幅度存疑所有 max effort 数据默认 effort 下表现会有差异评测前先确认档位。一句话总结这一代 GPT-6 Sol 的故事不是更聪明是同样聪明但诚实了一半、便宜了一半。对大部分开发者这比变聪明有用。资料来源Artificial Analysis《GPT-6 Sol and Luna push the cost efficiency frontier》2026-09独立实测OpenAI 官方发布公告与 Better Prompt Caching for GPT-6 说明MacRumors、AI Industry Today、AI Chat Daily 报道2026-09-22/23。本文基于第三方独立评测与官方公告整理数据以 AA 原文为准不构成投资建议。#GPT-6 Sol#Artificial Analysis#幻觉#大模型评测#OpenAI#成本优化

相关推荐

语音助手提示词
语音助手提示词

# # 银行语音助手 系统提示词 Pro 版 # 版本:v1.0 # 适用渠道:电话语音 / APP 语音 / 智能外呼(按需裁剪) # 说明:本提示词为母版,生产环境应按模块拆分 # # 第一部分:角色与身份## 1.1 基本身… · 2026/9/24 19:41:32

用Dash把pdfplumber封装成可拖拽的PDF解析Web应用
用Dash把pdfplumber封装成可拖拽的PDF解析Web应用

这年头做技术的人,谁没被“帮我看看这个 PDF 是怎么解析的”折磨过。pdfplumber 作为 Python 生态里解析 PDF 文本和表格的利器,写脚本自己用确实很爽,但一旦要交付给不懂代码的同事、客户或者业务人员,问题就来了:他们… · 2026/9/24 19:41:25

用Dash和pdfplumber打造零代码PDF解析Web工具
用Dash和pdfplumber打造零代码PDF解析Web工具

直接说结论:这个项目我很满意,把平时在命令行里来回折腾的pdfplumber,包了一层图形界面,变成一个浏览器里打开就能用、能用鼠标拖文件进去、点几下按钮就能抽文本、抽表格、定位关键词的Web小工具。做这个事的起因很简单&#xff… · 2026/9/24 19:41:25

AI Agent选型决策指南:OpenClaw平替与企业级落地实践
AI Agent选型决策指南:OpenClaw平替与企业级落地实践

1. 项目概述:这不是又一份“AI工具排行榜”,而是一张能让你少踩半年坑的Agent选型决策图OpenClaw这个词,最近三个月在技术群、GitHub Issues和小红书开发者笔记里出现的频率,已经快赶上当年Docker刚火起来时的“docker run”命令了… · 2026/9/24 20:56:57

显卡、GPU与显存的权力结构:低显存运行大模型实战指南
显卡、GPU与显存的权力结构:低显存运行大模型实战指南

1. 这不是硬件说明书,而是一份显卡使用生存指南你刚买了一张RTX 4090,满心欢喜装进机箱,结果ComfyUI跑两轮图就报“D3D设备已移除”;你查遍教程装好PyTorch GPU版,torch.cuda.is_available()却始终返回False&#xff1… · 2026/9/24 20:56:57

服务器与存储实战指南:硬件选型、RAID配置与性能调优
服务器与存储实战指南:硬件选型、RAID配置与性能调优

1. 这不是教科书,是我在机房摸爬滚打八年攒下的“服务器与存储生存手册”你点开这个标题,大概率正被三件事困扰:新接手的几台旧服务器总在半夜报警,领导突然问“我们那套存储是不是快到寿命了”,或者面试官盯着你问“R… · 2026/9/24 20:56:57

AI桌面自动化框架Cua:从视觉理解到跨平台动作执行的工程实践
AI桌面自动化框架Cua:从视觉理解到跨平台动作执行的工程实践

“AI 能看图、能写代码、能对话,可你要让它自己点开一个桌面软件、拉个滑块、在弹窗里点‘确定’,它大概率会卡在第一分钟。”这句话我过去几年反复对团队说。直到最近拿到标题里提到的 Cua 这类项目,我才意识到自己过去的判断该修正了。桌面… · 2026/9/24 20:56:57

从 Graphcool 迁移到 Prisma:Hooks、Resolver 与 Server-side Subscriptions 的落地改造指南
从 Graphcool 迁移到 Prisma:Hooks、Resolver 与 Server-side Subscriptions 的落地改造指南

后端数据库GraphQL 【免费下载链接】prisma1 💾 Database Tools incl. ORM, Migrations and Admin UI (Postgres, MySQL & MongoDB) [deprecated] 项目地址: https://gitcode.com/gh_mirrors/pr/prisma1 点击查看 免费下载 在 Graphcool Framework … · 2026/9/24 20:56:50

显卡GPU显存实战指南:从崩溃报错到低显存跑大模型
显卡GPU显存实战指南:从崩溃报错到低显存跑大模型

1. 这不是硬件说明书,而是一份显卡使用实战手记显卡、GPU和显存——这三个词最近半年在技术圈里几乎天天刷屏。不是因为新旗舰发布,而是因为它们突然从“打游戏用的配件”变成了“跑大模型的命脉”。我亲眼见过同事把一台i716G内存的笔记本塞进机房&… · 2026/9/24 20:56:50

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为… · 2026/9/24 0:00:13

1D-CNN时间序列建模实战:从Conv1d原理到工业落地
1D-CNN时间序列建模实战:从Conv1d原理到工业落地

简介:面向时间序列数据建模的一维卷积神经网络完整实现,适合深度学习入门者及需要快速验证时序模型的研究者,能够从音频、文本、传感器或股价等序列中挖掘局部特征与时间依赖。压缩包体积很小,只有3KB,内含3个Python脚… · 2026/9/24 0:00:26

柔软的L:汉语语流中被忽视的舌肌张力控制
柔软的L:汉语语流中被忽视的舌肌张力控制

1. 这个“L”不是字母表里的L,而是舌尖上的L最近在几个方言群和语音教学社群里,反复看到有人发一句:“也说字母L:柔软的长舌”。初看以为是英语发音课笔记,点开才发现全是方言爱好者、播音系学生、语言康复师甚至戏曲演… · 2026/9/24 0:00:44

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码