文章目录1. Jev 是个啥2. 装进 Codex三步走2.1 第一步把提示词甩给 Codex2.2 第二步注册拿 API Key2.3 第三步设置环境变量3. 实战让 Codex 学会请示3.1 这段提示词干了三件事3.2 Jev 到底怎么回的4. 灵魂拷问这活大模型也能干啊5. Jev 的三种决策方式5.1 Noul是还是不是5.2 Choice选一个5.3 Score打个分6. 名字的由来和一群复刻怪7. 最后说点掏心窝子的P.S. 目前国内还是很缺AI人才的希望更多人能真正加入到AI行业共同促进行业进步增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 传送门http://blog.csdn.net/jiangjunshow教程通俗易懂高中生都能看懂还有各种段子风趣幽默从深度学习基础原理到各领域实战应用都有讲解我22年的AI积累全在里面了。注意教程仅限真正想入门AI的朋友否则看看零散的博文就够了。最近干了一件特别像给自行车装火箭的事给 Codex 装了个叫Jev的判断模型。装完就一个感受——这玩意儿早该出了。1. Jev 是个啥先用人话解释。你玩过那种选择题吗给你四个选项让你选一个。Jev 干的就是这事你把当前状态 几个候选答案喂给它它告诉你选哪个还附送一个置信度比如选 B我有 99% 的把握。对就这么简单。简单到我一度怀疑它是来骗我 API Key 的。结果不是它是真干活。打个比方。以前让大模型做判断就像让米其林主厨来给你剥蒜——能剥剥得还挺好就是结账的时候你想报警。Jev 就是那个专门剥蒜的便宜、飞快、还不跟你废话。2. 装进 Codex三步走装它不需要写代码需要的是说代码。2.1 第一步把提示词甩给 Codex复制下面这段发给 Codex 就行Claude Code 和 PI 也都这么装命令都在提示词里了安装 TypeSafe 技能。如果你在 Claude Code 中请运行 claude plugin marketplace add typesafe-ai/skills然后运行 claude plugin install typesafetypesafe-ai。如果你在其他 Coding Agent 中请运行 npx skills add typesafe-ai/skills --skill typesafe-ai 并选择你的 Coding Agent。请使用其中一种安装方式。你可以直接阅读该技能的说明文档https://github.com/typesafe-ai/skills/blob/main/skills/typesafe-ai/SKILL.md。之后在开发此项目时即可使用 TypeSafe 技能。对就这么一段话Codex 自己跑去装了35 秒搞定。你让它装个依赖它能磨叽十分钟让它装技能它倒是挺积极。我怀疑它上辈子是装宽带师傅。装完之后从下一轮对话开始Codex 只要遇到判断、分类、路由、抽取、排序、验证这类活就会自动用上 TypeSafe Skill。比某些同事记性都好至少不用你在群里艾特它三遍。2.2 第二步注册拿 API Key去 TypeSafe AI 官网注册就行我花了大概两分钟。两分钟。比我注册健身卡还快而且注册完不会有人天天打电话让我去体验私教课。2.3 第三步设置环境变量在终端里跑一行export TYPESAFE_API_KEY你的 API Key想持久化的话把这一行加到.zshrc或者.bashrc里。不然你重启终端Key 就没了。比你对象生气时说的没事消失得还快。3. 实战让 Codex 学会请示光装不用是耍流氓。上真家伙。我设计了个场景用户问帮我分析今天英伟达股价为什么上涨但 Codex 不能自己拍脑袋决定干啥必须请示 Jev。3.1 这段提示词干了三件事使用 typesafe-ai Skill。这次任务的下一步动作必须由 Jev 决定。请实际调用 Jev API不要只进行文字分析。 state { userRequest: 帮我分析今天英伟达股价为什么上涨, knownFacts: [], availableTools: [直接回答, 联网搜索, 检查本地代码, 询问用户] } 问题为了可靠完成用户请求下一步应该采取哪个动作 候选项 - answer_directly已有稳定信息可以直接回答 - web_search依赖最新外部信息需要联网检索 - inspect_code需要检查本地项目文件 - ask_user缺少完成任务所必需的信息 - human_review风险较高或没有合适选项 执行规则 - 实际调用 Jev Choice。 - confidence ≥ 0.8 时Codex 执行 Jev 选择的动作。 - confidence lt; 0.8 时改为 human_review。 - 输出实际模型、Token 用量、完整概率和最终动作。 - 如果 Jev 调用失败停止并报告不允许 Codex 自行补充判断。第一把当前状态传给 Jev用户问了啥、已知啥、手里有哪些工具。第二给出 5 个候选动作每个都有明确定义。第三定规矩置信度到 0.8 才执行不到 0.8 就转人工。阈值自己调对准确性要求高的场景可以拉到 0.9 甚至 0.95。你品品这个设计。以前让 Agent 干活它是一边想一边干现在好了先问 Jev我该干啥Jev 说联网搜它才去搜。像一个怕老婆的程序员出门前先请示老婆我今晚能打游戏吗能置信度 0.99。那还等什么上号。对应的代码长这样官方 SDK 里的调用方式const client new TypeSafeClient(); const response await client.systemOne({ state: { userRequest: 帮我分析今天英伟达股价为什么上涨, knownFacts: [], availableTools: [直接回答, 联网搜索, 检查本地代码, 询问用户], }, questions: { nextAction: choice( 为了可靠完成用户请求下一步应该采取哪个动作, { answer_directly: 已有稳定信息可以直接回答, web_search: 依赖最新外部信息需要联网检索, inspect_code: 需要检查本地项目文件, ask_user: 缺少完成任务所必需的信息, human_review: 风险较高或没有合适选项, }, ), }, }); const answer response.answers.nextAction; const finalAction answer.confidence gt; 0.8 ? answer.choice : human_review;3.2 Jev 到底怎么回的我点开 Codex 的运行日志它真的发了个 HTTP 请求真调了 Jev 的 Choice API。Jev 回了这么个东西{ model: jev-1.13.0, usage: { input_tokens: 495, output_tokens: 63 }, choice: web_search, confidence: 0.99, probabilities: { human_review: 0, ask_user: 0.01, inspect_code: 0, web_search: 0.99, answer_directly: 0 }, finalAction: web_search }翻译一下web_search 的概率 0.99ask_user 0.01剩下三个直接归零。Jev 的态度非常明确这题必须联网搜别跟我扯别的。0.99 是个什么概念大概等于你对象说我没生气的可信度再乘个 1.1。然后 Codex 就真的乖乖去搜了搜了为什么今天英伟达股价涨。看到这里我悟了**判断交给 Jev执行交给 Codex各司其职。**以前是一个模型又当裁判又当运动员现在裁判终于专业了。4. 灵魂拷问这活大模型也能干啊肯定有人要问意图识别嘛我让大模型做不就行了干嘛多此一举能做真能做。但账要算清楚。TypeSafe 官方给的数据Jev 比同类 LLM 快 40 到 200 倍便宜 40 到 400 倍。输入价格 0.042 刀每百万 Token输出免费延迟 70 到 500 毫秒。注意最后四个字输出免费。建议全行业大模型公司把输出免费抄进 KPI 里。你让大模型做一个选 A 还是选 B的判断它给你输出三百字小作文最后说综上所述我建议选 A。兄弟我就想让你说个 A不是让你写毕业论文。Jev 的思路是把判断从大模型里单独拆出来做成一个轻量专用模型。它不需要理解整个世界只需要理解你给的 state 和候选项之间的关系。简单说大模型是全能选手Jev 是专项运动员。你让全能选手去跑百米能跑就是出场费太高。5. Jev 的三种决策方式Jev 支持三种决策类型基本覆盖了 Agent 开发里所有拿不定主意的场景。5.1 Noul是还是不是给一个是/否的概率0 到 1 之间。比如判断一条评论有没有恶意。0.95 以上基本实锤0.05 以下基本清白中间地带转人工——也就是把锅甩给真人审核非常合理的甩锅。再比如 Agent 准备调一个工具先让 Noul 过一道安检这次调用有没有风险有就拦没有就放行。5.2 Choice选一个从预定义的选项里选一个附带每个选项的概率。适合意图路由、工具选择、任务分发。比如客服 Agent 收到消息判断转技术支持、账单查询还是投诉处理——比某些大厂客服那个请按 1请按 2人工客服请按 9的智能菜单靠谱一百倍。按完九层菜单人工客服下班了。5.3 Score打个分0 到 1 打分。RAG 召回 20 个文档片段Jev 挨个打分0.9 高度相关0.3 勉强沾边。按分数排序取前几个喂给大模型生成回答。这招我熟当年大学期末划重点我就是这么给复习资料排序的。Score 还能做质量评估Agent 生成一段回答打个分分低的让它重写分高的直接交差。比某些领导再改改的反馈至少带个数值。三种还能组合先用 Choice 选工具再用 Noul 查安全工具返回结果后用 Score 打分分数低就重来。一套组合拳下来Agent 每一步都有据可查。6. 名字的由来和一群复刻怪Jev 这名字取自 19 世纪经济学家 William Stanley Jevons边际效用理论的提出者。意思是每一次判断都要追求最高的边际效用用最小的成本得到最准的结果。翻译成大白话花最少的钱办最准的事。这价值观建议所有乙方公司抄作业。甲方问这个方案多少钱乙方回保证最高边际效用甲方虽然听不懂但觉得很专业。现在社区里已经有人整理了 Jev 的案例库202 个案例原帖总浏览量 1 亿。判断模型这个赛道热得能煎鸡蛋。更离谱的是开源复刻已经卷起来了kevQwen3.5 LoRA最知名知名开发者 Jared Palmer 用 Devin 写的。模型写模型AI 套娃套娃还套得挺好。laya原生非自回归T4 显卡上每道题推理只要 7.2ms。快到什么程度比你手滑点错链接的反应还快。Open-Jev9B 版本一致率 97.54%本地接口中位延迟 85ms 左右对标 Jev 云端的 295ms。Nimble训练思路叫找不同把 Qwen 的决策一致率从 66.36% 拉到 90.12%逼近 Jev 官方的 93.21%。NanoJev0.6B 参数2GB 内存就能跑适配手机。2GB 内存比某些浏览器还省比某些聊天软件还省。Jev 这波属于是一个模型火了全村复刻。7. 最后说点掏心窝子的用认知科学的说法Jev 是 System 1直觉秒出答案大模型是 System 2深度推理。人做决定大部分时候靠直觉只有复杂问题才启动深度思考。Agent 也应该这样简单判断交给 Jev70 到 500 毫秒出结果真要推理、要写内容的复杂任务再让大模型慢慢想。我估计后面的大模型都会快速跟进这一块。毕竟判断模型做起来不难难的是有人先想到判断可以单独拆出来卖。最后吐槽一句现在的 GPT-6 Astra 太费 Token 了。以前一周的额度用不完现在三天就见底。Jev 至少能帮 Codex 省点额度——省下的 Token都是程序员续命的口粮。行今天就到这。我去给 Codex 装下一个外挂了。P.S. 目前国内还是很缺AI人才的希望更多人能真正加入到AI行业共同促进行业进步增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 传送门http://blog.csdn.net/jiangjunshow教程通俗易懂高中生都能看懂还有各种段子风趣幽默从深度学习基础原理到各领域实战应用都有讲解我22年的AI积累全在里面了。注意教程仅限真正想入门AI的朋友否则看看零散的博文就够了。
企业数字化 ERP 产品动态
相关推荐
S7-1500硬件版本降级:TIA Portal中被隐藏的高危操作与安全执行指南 1. 为什么“硬件版本降级”在TIA Portal中是个被刻意隐藏的高危操作TIA Portal V19环境下,面对一台标称固件为V3.0的S7-1500 CPU,你突然发现现场工艺程序只兼容V2.8——不是软件不兼容,是PLC底层指令集、安全机制甚至硬件寄存器映射都发生了实… · 2026/9/26 6:52:48
AI营销闭环实战:中小商家的自动化内容生成与多模态协同 这年头,AI连营销都一条龙服务了——这句话刚刷出来的时候,我正帮一个做手工皮具的客户搭私域转化链路。他发来截图,上面是某平台新上线的“AI营销工作台”,从选品分析、文案生成、海报设计、短视频脚本、投放策略到数据复盘&#… · 2026/9/26 6:52:42
React框架搭建:API请求管理规范化与Mock数据方案 很多前端项目做着做着就乱了,往往不是乱在页面组件,而是乱在接口请求。后端接口没写好,前端干等;接口文档改一个字段,前端要翻十几个文件;线上出了问题,查了半天才发现是请求层没做统一处理。这… · 2026/9/26 6:52:42
基于Python校园食堂点餐系统:源码、数据库与部署实战 作为一个前后端都写过、也带过不少学弟学妹做课设的过来人,我第一眼看到“基于Python校园食堂点餐系统(源码数据库文档)”这个标题,就知道这类项目在课程设计和毕业设计里有多高的出场率。关键是这个组合很完整:有源码、有数据库、有文档&… · 2026/9/26 7:55:52
放弃WordPress:用WorkBuddy+Flask+SQLite从零搭建日更内容站 1. 为什么我放弃了WordPress,转头用WorkBuddyFlask从零搭站先说结论:如果你跟我一样,是个想快速把脑子里的想法变成能跑起来的网站、又不想被各种建站平台的模板和插件绑架的人,那WorkBuddy配合Flask和SQLite这套组合,… · 2026/9/26 7:55:26
Tool安全沙箱选型:Docker、gVisor与WASM三层防御架构 1. 为什么“Tool”这个词在安全语境下突然变得刺眼?最近翻了几轮企业级工具链的 incident report,发现一个反直觉现象:越是标榜“开箱即用”“一键部署”的 tool,越容易在渗透测试报告里被标红。不是因为功能弱,恰恰是… · 2026/9/26 7:55:20
MCP协议安全深度解析:从原理到六大风险与检查清单 如果你关注过2025年初的AI圈,一定对MCP协议不陌生。Anthropic开源的Model Context Protocol,也就是MCP协议,被媒体称为“AI生态的USB-C接口”,短短几个月内,Google、OpenAI、Microsoft等大厂相继宣布支持,M… · 2026/9/26 7:55:20
Unity Mesh内存优化:Read/Write开关与性能调优实战 1. 从一次线上事故说起:Mesh内存为什么会失控项目上线第三周,测试同学反馈角色在切换场景时偶发卡顿,帧率从稳定的60帧掉到20帧以下,而且设备发热明显。抓了Profiler一看,Mesh相关的内存占用在场景切换后不降反升&… · 2026/9/26 7:55:20
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍 简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践 一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46