首页/新闻资讯/正文详情

Jev 发布 3 天后,开源平替 Laya 来了:快 8 倍,权重全开

发布时间:2026/9/24 17:45:29 来源:云帆数科 栏目:资讯中心
Jev 发布 3 天后,开源平替 Laya 来了:快 8 倍,权重全开
Jev 发布 3 天后开源平替 Laya 来了快 8 倍权重全开一个不写一个字、只输出带概率判定的模型新品类一周之内集齐了闭源版、开源版和两份民间复现。AI 不写字了专管下判断9 月 15 日前 OpenAI 研究员 Diogo Almeida 的公司 TypeSafe AI 发了第一款模型 Jev。这位老哥参与过 RLHF、InstructGPT 和 ChatGPT 的核心研究这次做的模型偏偏把「说话」这个功能整个砍了。Jev 不生成任何文本。你给它一段状态比如一封邮件、一张工单、一段对话记录再给一组限定好选项的问题它一次算完直接吐回判定和概率。三种问法choice 从你定义的选项里挑一个score 按 0 到 3 这种量表打分noul 回答是否问题并给出校准过的 P(true)。官方口径端到端延迟 70 到 500 毫秒比前沿大模型做分类快 20 到 200 倍、便宜 40 到 400 倍。输入每百万 token 0.042 美元输出 token 永久免费对因为根本没有输出 token。价格之外更值钱的是「校准」。模型报 0.85 的置信度长期看真实命中率就在 85% 上下这个数字你敢直接拿去写 if 判断。普通大模型输出的 confidence 0.95 只是预测了一串听起来自信的 token背后没有数学校准这一说。社区三天就玩疯了。Vercel 拿它替换分类器里的大模型实测快 5 到 18 倍准确率还更高。BrowserUse 创始人接了 Jev 的浏览器 Agent 查真实航班全程 7 秒、成本 0.0039 美元99% 的动作决策都交给它。Hacker News 相关讨论冲到 3700 多万浏览。好家伙这个价格一出来各家 Flash 模型都得重新想想定位。名字也不是随便起的Jev 取自经济学家杰文斯暗合杰文斯悖论单次判断成本暴跌整体用量会暴涨。三天不到开源版追上来了那开源呢9 月 18 日印度 ConvAI Innovations 发布 LayaApache 2.0 协议权重、代码、训练脚本、评测集全公开。GitHub 上线三天 6700 starHuggingFace 热门模型榜冲到第三。时间线有点绕。Laya 的作者 Nandakishor Mukkunnoth 在 2025 年 3 月就把非自回归决策模型的论文挂上了 arXiv比 Jev 早了一年多比 Jev 早发论文的人回头做了个 Jev 开源版。Jev 发布三天后他把自己的方案重构成通用版跟进开源正面对标。Laya 本体是个编码器英文版基于 ModernBERT-large总参数 421M多语言版基于 mmBERT-base总参数 322M覆盖 100 多种语言。内置 Router 先毫秒级识别语言再分发到对应 checkpoint。跑起来很省事。pip install laya本地 GPU 推理自托管零 token 费用三个 checkpoint 按需选laya 英文主力、laya-multilingual 多语言、laya-typed-decisions 专攻分支判定生产环境建议 Router(preloadTrue) 预加载不然切换语言要重新加载好几秒速度数字放一起才有感觉。第三方实测 Jev 的 P50 延迟在 236 到 276msLaya 单次判定 32.8ms快了将近 8 倍批量场景下摊到每题只要 7.2ms。一次前向打分快从哪来传统 LLM 是自回归一个 token 接一个 token 串行往外吐哪怕你只要它回一个「A」它也得先把「答案是」几个字写完。Laya 给每个候选项安排一个 [MASK] 标记位整段序列过一遍双向编码一次前向传播同时算出所有选项的分数Softmax 一下就是概率分布。没有文本生成就没有解析失败也没有格式幻觉。你给 A、B、C 三个选项它绝不会自作主张编个 D 出来。训练用的是 RLCD面向校准决策的强化学习奖励函数选严格适当评分规则数学上能证明模型只有报告真实概率才能拿最高分。数据 100% 人类标注不走合成捷径。有个细节我挺喜欢。它带一个「行动还是升级」的决策头用成本矩阵训练自动执行错了罚 3 分做对只奖 1 分转人工只罚 0.5 分。算下来置信度低于 62.5% 就老实转人工这个阈值不是拍的是罚则算出来的。数字要看全Laya 也有输的光看厂商的一面之词不行把两边公开数据摆在一起。指标JevLaya单次判定延迟P50 约 236 到 276ms32.8msT4 GPUtyped-decisions 准确率0.7270.766微调 checkpoint校准误差 ECE越低越好0.2460.081Banking7777 类0.8700.425默认配置开源情况闭源 APIApache 2.0 全开两个坑得说清楚。第一Laya 那个 0.766 的成绩来自在这个 benchmark 训练集上专门微调过的 checkpoint模型卡自己承认的这点挺诚实不算完全公平的对决。第二选项一多 Laya 会崩Banking77 上 77 个类别Jev 拿 0.870Laya 默认配置只有 0.425原因是每个选项分到的 token 预算太少。选型思路就一条25 个选项以内的意图路由、安全护栏、工单分流Laya 又快又便宜校准还好。几十个以上类别的精细分类目前还是 Jev 稳或者老实回大模型。同期还有两份开源复现Jev 把这条路线带火之后开源圈 48 小时内卷出了好几个版本除了 Laya 我还翻了两个。NimbleBespoke Labs 出品Qwen3.5-9B 做 LoRA 微调数据、训练配方、权重全开源。思路是对比式数据构造改一个关键事实让标签翻转逼模型学会抓重点。自家评测里基座 66%、Nimble 90%、Jev 93%H100 上约 100msMacBook 本地能跑。说实话这条我只看了发布帖没跑过APUS 麒麟合盛 9 月 19 日放的复现MIT 协议打包成开箱即用的 fast-browser-use 技能专攻浏览器自动化。Qwen3.5-9B 纯本地离线跑M2 Pro 笔记本上维基检索任务中位约 18 秒完成单任务模型打分只有 4 次零云端调用同一个范式48 小时内出了三条工程路子。Nimble 走 9B 生成模型微调Laya 走小编码器小、快、准APUS 走场景复刻。你想自托管决策能力现在选项比一周前多了一倍。点链接打游戏翻车的不少路由、分类这类直路判断Jev 们确实能打。可场景一变成「下一步该点哪个链接」「这局什么时候该点」翻车的案例就多起来了。最扎眼的是 Browser Use 创始人自己做的长链任务测试就是那位 7 秒订机票的博主。20 道真实网页任务对照的 Luna 拿了 17 分Jev Agent 只拿 1 分19 道直接失败。输得不冤7 秒订机票是填表、选择、提交一条直路没有分支真实网页会弹验证码、弹广告、点进死路Jev 没有推理也不会回溯卡住就是卡死。这位创始人的原话浏览器交互从来不是简单的元素点击是高维状态空间搜索。游戏这边也一样。有人拿 2048 测它只给棋盘不给别的成绩比乱猜还差24% 的步子是原地空挪把每一步的预计算结果喂进状态里中位分直接翻三倍多。井字棋更说明问题约 8% 的局面不管怎么改提问都答不对因为正确答案需要推演「我走这步之后对面怎么应」单次前向没有草稿纸这种题它天生做不了。还有个坑特别阴。有人做链接选择时为了省 token把页面截断成前 25 个候选正确答案排在第 103 位8 次全错而且模型每错一次都报 0.76 以上的置信度。选项没给全它不会说不知道只会从烂菜单里挑一个最顺眼的。交易更别碰。有开发者让 Jev 持续判断买卖一晚亏掉 31680 美元德州扑克 GTO 对照测试里真正有争议的点位吻合率只有 38%。小马智行架构师程墨的测试更值得琢磨无论把规则改成优先到达还是越快越好两难场景里它都坚持选急刹车脑子里那套默认规则排在用户指令前面。Agent 里的判断多少要过大模型这事跟做 Agent 的人直接相关。你想想看一个 Agent 跑一轮要调用多少次大模型意图路由、安全检查、结果验收、下一步选哪个工具大部分是二选一或五选一的快速判断却都在按推理模型的价格排队。Jev 这一波验证的就是快慢分工。System 2 的慢思考留给大模型System 1 的快判断交给毫秒级决策模型两边各干各的。我自己先试了一小步。RAG 问答 Agent 里的模型路由和工具选择这两步原来每步都要过一遍大模型几百毫秒到一两秒不等。换成决策模型之后是几十毫秒的量级粗算快了 10 到 30 倍token 钱基本归零。把丑话说在前面只测了这两个场景没做严格基准别的环节不敢下结论。再看上面那些翻车案例就清楚了长链任务、屏幕上的时序判断、需要推演和回溯的活老实留给大家模型。也别指望决策模型替代大模型它替代的是你 Agent 里那些「其实不需要动脑子」的判断。你的 Agent 里这种判断占几成评论区聊聊。数据来源TechCrunch2026-09-18、量子位、Artifilog、AI Pro Playbook、新华网2026-09-21、央广网2026-09-20、腾讯云开发者社区、ZiCode、shaharia.com、robertwent.com、GitHubNandhaKishorM/laya、bespokelabsai/nimble、HuggingFaceconvaiinnovations/laya数据截至 2026-09-22

相关推荐

【AI大模型进阶】整理你的 AI 工具集:构建属于你自己的 AI 开发百宝箱
【AI大模型进阶】整理你的 AI 工具集:构建属于你自己的 AI 开发百宝箱

【AI大模型进阶】整理你的 AI 工具集:构建属于你自己的 AI 开发百宝箱 这是【AI大模型进阶】系列第一百五十课,也是本系列算力工程、云端开发、模型训练运维板块的收官总结课。在前序149节课程中,我们从零入门,逐一掌握了云端算力租赁、SSH远程开发、Tmux终端保活、GPU状态… · 2026/9/24 17:45:29

MySQL数据库基础——数据库的约束
MySQL数据库基础——数据库的约束

文章目录约束非空约束 not null唯一约束 unique默认值 default主键 primary keyprimary key主键的自增类型复合主键外键 foreign keycheck(了解)约束 约束是关系型数据库的一个重要功能,主要作用是通过加上约束的校验来保证数据的完整性&… · 2026/9/24 17:45:29

【Matlab】运动目标无人机视觉跟随控制实现
【Matlab】运动目标无人机视觉跟随控制实现

【Matlab】运动目标无人机视觉跟随控制实现 一、引言 随着智能无人机技术的快速迭代,无人机自主跟随飞行已经成为智能巡检安防监测野外追踪物资跟随运输等场景的核心功能。传统无人机跟随作业多依靠人工遥控或GPS定点跟随模式,存在明显的技术短板。GPS跟随依赖卫星定位信号… · 2026/9/24 17:45:29

Link入门全解:网页新标签打开、网络链路聚合与PLC通信协议
Link入门全解:网页新标签打开、网络链路聚合与PLC通信协议

做技术这行久了你会发现,很多基础概念翻来覆去就那么点东西,但每次重新回头去理解,又总能有新的收获。“Link”这个词就是典型,它算得上是我入行以来接触频率最高的词之一,但不同场景下它代表的东西完全不一样——前端… · 2026/9/24 18:45:38

Python气象时间序列预测实战:降雨量建模与工程化部署
Python气象时间序列预测实战:降雨量建模与工程化部署

简介:本资源是一个面向高校课程设计与Python后端开发初学者的降雨量预测实践项目,聚焦时间序列分析在气象预测中的落地应用,解决农业灌溉规划、气象预警等实际场景下的短期降雨趋势预判问题。压缩包为ZIP格式,大小42.49MB&#xf… · 2026/9/24 18:45:38

AI学术全流程实战:从文献综述到答辩PPT,提示词与部署排错指南
AI学术全流程实战:从文献综述到答辩PPT,提示词与部署排错指南

上周帮一个研三的学弟过开题材料,他跟我抱怨:AI工具他一直在用,翻译文献、润色语句、查语法,样样都试过,可真到了写综述、搭方案、做答辩PPT的时候,还是抓瞎。我问他怎么不用AI继续帮忙,他说“每… · 2026/9/24 18:45:38

无线网络仿真从入门到实战:信道建模与工具选型全解析
无线网络仿真从入门到实战:信道建模与工具选型全解析

1. 仿真思路拆解:为什么无线网络离不开仿真做无线网络这么多年,我越来越觉得网络仿真不是“锦上添花”的选修课,而是必修课。真实环境里你不可能为了验证一个组网方案,专门去买几十台AP、搭一整套AC、再拉几条专线做测试&#xff… · 2026/9/24 18:45:25

Spring Boot + Vue3 + MinIO 大文件分片上传实战:直传、断点续传与秒传
Spring Boot + Vue3 + MinIO 大文件分片上传实战:直传、断点续传与秒传

我接手过好几个类似需求的项目,从早期做后台管理系统开始就一直在跟文件上传打交道。以前用传统的MultipartFile整包上传,文件小的时候还行,一旦涉及到几百MB甚至几个GB的视频、压缩包、数据库备份文件,问题就全冒出来了&#xff… · 2026/9/24 18:45:25

Linux命令行删除全攻略:从输入纠错到卸载软件一次讲透
Linux命令行删除全攻略:从输入纠错到卸载软件一次讲透

说句实话,第一次在群里看到“在Linux中如何删除命令行?”这个问题的时候,我以为对方在开玩笑。毕竟命令行是Linux里最核心的交互入口,哪有人会想把它“删掉”?可后来聊了几句才明白,新手们说的“删除命令行… · 2026/9/24 18:45:25

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为… · 2026/9/24 0:00:13

1D-CNN时间序列建模实战:从Conv1d原理到工业落地
1D-CNN时间序列建模实战:从Conv1d原理到工业落地

简介:面向时间序列数据建模的一维卷积神经网络完整实现,适合深度学习入门者及需要快速验证时序模型的研究者,能够从音频、文本、传感器或股价等序列中挖掘局部特征与时间依赖。压缩包体积很小,只有3KB,内含3个Python脚… · 2026/9/24 0:00:26

柔软的L:汉语语流中被忽视的舌肌张力控制
柔软的L:汉语语流中被忽视的舌肌张力控制

1. 这个“L”不是字母表里的L,而是舌尖上的L最近在几个方言群和语音教学社群里,反复看到有人发一句:“也说字母L:柔软的长舌”。初看以为是英语发音课笔记,点开才发现全是方言爱好者、播音系学生、语言康复师甚至戏曲演… · 2026/9/24 0:00:44

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码