首页/新闻资讯/正文详情

大模型架构演进史:从 Transformer 到 Jev

发布时间:2026/9/27 22:58:08 来源:云帆数科 栏目:资讯中心
大模型架构演进史:从 Transformer 到 Jev
本文基于公众号「淚笑的赛博日记-起零衍迹实验室」的文章《从 Transformer 到 Jev —— 大模型架构的演进》扩写并对原文涉及的关键事实做了一轮联网核对核查结果列在文末附录。全文含 11 张图解。2026 年 9 月 15 日一家叫 TypeSafe AI 的公司发布了一个叫 Jev 的模型。它不生成文字。你给它一段材料工单、日志、邮件、JSON再附上若干问题它直接返回各选项的概率——从选项里选一个、在等级上打分、或者判断某个陈述是否成立。多数查询约 100 毫秒。它的创始人 Diogo Almeida 是 InstructGPT 论文的作者之一在 OpenAI 负责过后训练。发布文章的第一句话就是问题所在Models have been superhuman at chat for years, so where is all the automation?模型在闲聊上超越人类好几年了可自动化在哪里他的解释是RLHF 训练出来的模型从设计上就是为协助人准备的——奖励模型拟合人类评分者的偏好模型学会让回答看起来正确而不是让概率反映真实的正确率。一个模型如果在 95% 的情况下能完成任务却无法指出剩下的 5% 在哪里就不能用于无人值守的自动化。要讲清 Jev 站在什么位置得回到 2017 年。有意思的是这九年里主流大模型的骨架几乎没变过。 变的是骨架之外的四个地方——训练方式、内部组件、输出方式以及两半拆不拆。Jev 动的是最后一项也是此前没人认真动过的一项。图 1 演进主线。灰点 骨架与路线的确立蓝点 只改训练方式紫点 只改内部组件绿点 改掉了输出方式。九年里只有最后两个绿点动了结果怎么产生这一环。一、地基为什么原始 Transformer 是两半先不提术语。翻译这件事的本质是进去一句英文出来一句中文两边长度都不固定。 你没法用一个固定尺寸的盒子装住任意长的句子。所以最早的做法RNN 时代的 seq2seq就拆成两半——一半负责读懂把整句话的意思压成一小团数字另一半负责说出来一边看那团数字一边一个词一个词往外蹦。2017 年的《Attention Is All You Need》把两半这个框架原样保留了所以文章说两段式本身并不是这篇论文的贡献它真正换掉的是里面的循环用注意力取代了 RNN。图 2 读一次写多次。这是整篇文章最重要的一张结构图。后面所有讨论的改了哪一半省掉了哪一步都是在这张图上做加减法。它换掉的东西为什么那么关键注意力到底干了什么用大白话讲处理某一个词的时候直接去句子里所有词那里看一圈谁跟它关系近就给谁高权重然后按权重把大家的含义加权求和。经典例子是 The animal didnt cross the street because it was too tired.——算到 it 的时候animal 会拿到很高的权重模型于是知道 it 指的是那只动物。这一步为什么是硬门槛因为 RNN 必须等第 n−1 个词处理完才能算第 n 个词GPU 上几千个核心一大半在闲着注意力一上来所有位置同时算完。这不是一个学术上的漂亮而是一个能不能做大的工程前提。 没有并行就没有后来的千亿参数。一句话记住这三个角色Encoder 读的那一半跑一次。Decoder 写的那一半跑 N 次每次要回头读一遍 Encoder 的输出cross-attention。自回归 每一步的输出去喂自己下一步的输入。模型实际处理的单位叫 token分词器切出来的中文约一个字到一个词英文约一个单词或其一部分。二、一条判据分清所有路线2018 年前后研究者发现 Transformer 的这两个部件可以拆开单独用而且各自适合不同的练习题。由此分出三条路线。关键在于这三条路线在层结构上几乎一样。真正的差别只有两条——注意力的可见范围读输入时能不能看到后文和预训练任务训练时做的是填空还是续写。而可见范围的差别用一张 5×5 的格子就能说清图 3 因果掩码长什么样。右边那张图右上角的灰色三角就是 causal mask。原因很朴素后面的词还没生成出来不能偷看答案。为什么判别的场景离不开双向这一层想通了后面全通。举一个具体的例子判断苹果指的是公司还是水果。图 4 不能看后文在两种任务里的含义完全不同。生成任务里后文还不存在遮蔽它是刚需判别任务里后文是已经拿到的输入遮蔽它纯属自残。三条路线对照路线代表留了哪一半注意力预训练任务擅长什么Encoder-onlyBERT2018.10只留读双向完形填空遮住词靠前后文还原检索、推荐、内容审核这类高吞吐判别Encoder-DecoderT52019.10两半都留编码双向 / 解码因果遮住一段话让 Decoder 补出来翻译、摘要输入输出形态固定Decoder-onlyGPT-12018.06只留写因果续写给定前文预测下一个词对话、代码、推理、工具调用一个容易踩的坑Decoder-only 里的 Decoder 已经不是那个 Decoder 了图 2 里那个会回头读上下文向量的 Decoder靠的是cross-attention。但 Decoder-only 模型里的 Decoder 已经没有 cross-attention 了——因为它前面根本没有 Encoder 可读。它在结构上等价于一个施加了因果掩码的 Encoder还叫 Decoder 纯属历史遗留。所以判断一个模型属于哪条路线看名字没用只看两点① 注意力是不是因果掩码② 结果是不是逐 token 生成出来的。 文章后面讲 DeepSeek 时说它的 encoder-decoder 与翻译的两段式含义不同根子就在这个命名混乱上。三、Encoder-only擅长什么以及它到底差在哪一句话定位只留读的那一半双向注意力训练时做完形填空。它不生成任何文字出口是一组概率。这一节分两段先讲它擅长什么、为什么再回答一个最容易被搞混的问题——它跟 Jev 那一类模型到底差在哪。图 5 Encoder-only 的数据流。和图 2 对比没有 Decoder、没有 cross-attention、没有接回输入的回环。输入进去一个向量出来接个小分类头概率就出来了。擅长什么一句话判断标准任务形态是输入一段文字 → 输出一个判断而不是输入一段文字 → 输出一段新文字。 前者是判别后者是生成。Encoder-only 只做前者。场景具体任务为什么合适检索 / 召回把文档和 query 各编码成向量算相似度一次前向就能编码百万文档可以离线提前算好重排 Rerank对召回的候选文档打分排序打分本质是回归/分类不需要生成任何文字推荐判断这个用户和这条内容是否匹配同上且要高 QPS内容审核是否违规、是否垃圾、是否敏感毫秒级 可大批量并行成本极低意图 / 情感分类客服工单路由、舆情判向、优先级类别固定、标注充足时比调 LLM 更准更便宜向量化 / 实体抽取句向量、NER 打标签输出是每个 token 的标签也不需要生成为什么擅长这些除了图 4 那条双向可见之外还有两个机制在起作用① 出口不同——输出概率不是输出文字你在图 5 看到的那个概率面板是网络直接算出来的不需要先吐一个字符串再由外面解析。因此延迟与答案有多长无关不存在逐 token 串行的瓶颈连 KV cache 都用不上只跑一次缓存没有意义。② 输出粒度天然匹配判别任务判别要么要一个句级判断整句一个标签要么要词级标签NER。Encoder 的输出正好是每个 token 一个向量取一个或取全部接个头就完事。而如果用 LLM 做分类你得让它 decode 出technical这一串字符再由你的代码去解析——一个纯粹的字符串搬运环节还顺带丢掉了概率信息。那它为什么退出了通用能力竞争注意不是因为能力差而是因为训练信号太稀疏。续写任务在句子的每一个位置都能出一道题100 个词 100 道题。填空任务只能在被遮住的少数位置出题遮 15% 15 道题。同一批文本Decoder-only 拿到的训练信号密好几倍。而 BigScience 团队 2022 年的系统对比Wang 等arXiv:2204.05832给出了经验结论[已核实] Wang 等 2022 年的实验设计论文《What Language Model Architecture and Pretraining Objective Work Best for Zero-Shot Generalization?》2022 年 4 月 12 日提交 arXiv。作者来自 Hugging Face / Google / LightOn / AI26 个超过 50 亿参数的模型每个训练 1680 亿 token覆盖 3 种架构因果 decoder-only、非因果 decoder-only、encoder-decoder× 2 种目标自回归、掩码语言建模在 2 个基准的 30 个任务上评测含/不含多任务提示微调。结论 只做纯无监督预训练时因果 decoder-only 自回归目标的零样本泛化能力最强而非因果可见性 掩码目标在加上多任务微调之后表现最好。行业恰好把资源全押在了前者。使用范式预训练 微调以及它的代价图 6 两段式使用范式。类别写进参数这句话指的就是第 ② 步——分类头的输出维度在微调时被定死。顺带补一句这条路线并没有死。2024 年的 ModernBERT 就是例证——它是 Answer.AI 与 LightOn 在 2024 年 12 月发布的当代版本base 1.49 亿参数 / large 3.95 亿参数上下文从 512 拉长到 8192把 RoPE、GeGLU、FlashAttention 2 这些 LLM 时代的组件搬回了 encoder。[已核实]选项写进输入这件事 encoder 早就会前面说类别写进参数指的是微调分类器的任务边界在训练时就被定死了。但这句容易带出一个误解好像把选项写进输入、直接读出概率是 Jev 这一类新模型才有的本事。不是。这套用法在 encoder 时代2019–2020就已经成熟了而且它跟选项放输入还是放参数根本无关。真正要分清的是这一点它构成的是 Laya 与类别写死在参数里的微调分类器之间的差别而不是与 encoder-only 这个架构之间的差别。换句话说读概率这件事本身早就是常规操作真正的差别在底下的理解能力而不在选项放在哪儿。encoder 时代是怎么做的把标签写成一句假设最典型的做法叫 zero-shot NLI 分类由 Yin、Hay、Roth 在 EMNLP 2019 的论文《Benchmarking Zero-shot Text Classification》提出 [已核实]把待分类的文本当作 premise前提把每个候选标签套进一句模板做成 hypothesis假设比如This text is about {label}送进一个在 MNLI 上预训练过的 BERT 做 NLI 判断蕴含 / 中立 / 矛盾取蕴含的概率作为这个标签的得分——选项就在输入里出口就是概率不需要为新任务训练。图 7 选项写进输入encoder 时代就在做。注意选项 N 个 → 跑 N 次这一行它是 Laya 后面要改进的地方。做法输入长什么样出口时间Zero-shot NLI 分类文本 [SEP] 这句话在说{标签}蕴含概率每个标签跑一次2019–2020Cross-encoder 重排[CLS] query [SEP] document一个相关性分数每个候选跑一次2019 起广泛使用Laya 的做法指令 每个选项前放 [MASK] state各选项概率softmax2026.09三者共同点完全一致选项候选是输入的一部分而不是参数的一部分出口是概率而不是文字。 所以一次前向读概率这件事encoder-only 用 4 亿参数就做到了——它不是 Jev 的护城河。那真差距在哪就一个字指令图 8 差距不在这两块之间而在这两块之上。左侧是记住几个模板右侧是读懂一段任意写的话。跟选项放输入还是放参数完全无关。再补一条数据Yin 等人的原始实验里也有同样的限定——他们明确说过这个方法对模板质量非常敏感。换个领域就得重新设计模板这本身就是指令不够通用的证据。[已核实]Laya 相对微调分类器往前走的是哪三步相对一个典型的、类别固定的 BERT 分类器Laya 的真正差别是这三条都不在选项放哪多选项压进一次前向。 传统 cross-encoder 是1 个 query × 1 个候选 1 次前向N 个候选跑 N 次图 7 里那行选项 N 个 → 跑 N 次。Laya 靠在每个选项前塞一个[MASK]、之后在[MASK]位置取隐向量打分把同一问题的所有选项压进一次前向。多问题共享同一段 state。 每个问题拼一条序列指令和选项在前、state 接在最后一次请求可以带若干个问题。把概率校准当成训练目标。 传统分类器只管 argmax 对不对不关心概率准不准Laya 和 Jev 明确以校准为目标。Laya 的 RLCD 奖励用严格恰当评分规则strictly proper scoring rules使得模型唯一能最大化奖励的方式就是报告诚实的概率。[推断] 一条文章没说、我从它的设计里推出来的结论Laya 与 Jev 在多问题并行上的能力其实不对等原因是双向 encoder 没法复用 stateJev因果state 放前面后面的问题只往后看 → state 算完就固定了可以复用。所以文章说它同一请求里增加问题几乎不增加耗时。Laya双向state 放在序列末尾前面每个[MASK]都要 attend 到它——反过来state 的表示也会被前面的问题影响。所以每加一个问题state 都得重新编码一遍。这不是实现细节是双向注意力的结构性后果前缀可缓存是因果掩码给的红利。 类型安全 AI 的创始人后来专门写过一篇题为《The Tyranny of the KV Cache》的笔记谈的正是 KV cache 效率如何支配执行成本。四、Decoder-only 为什么赢prefill 与 decode对 Decoder-only 模型来说理解输入与生成输出并不对应两个网络而是同一个网络、同一套参数在推理时的两个阶段。图 9 prefill 与 decode。这两个词是理解后面所有性能优化的前提首字慢 prefill 慢生成慢 decode 慢两者瓶颈完全不同一个吃算力一个吃显存带宽。输出读取输入这件事在 Decoder-only 里同样发生只是不再通过 cross-attention而是通过普通的自注意力回答的每个 token 与 prompt 处于同一条序列直接查看 prompt 各位置的键、值即可。它成为主流的三个原因原因说明① 训练信号更密集续写任务在每个位置都能出题每个词都是前文的预测目标填空只能在被遮的少数位置出题。同样一批文本前者提供的信号多得多。② 任务形态统一对话、代码补全、思维链、工具调用都可以表述为在同一序列上继续生成不需要为每类任务重新定义输入输出边界。GPT-3 的上下文学习能力正是这种统一带来的。③ KV cache 可以复用因果掩码保证已处理 token 的键值不受后续内容影响多轮对话与 agent 循环只需追加。双向 Encoder 不具备这一性质。把 ②③ 连起来看就是第三章里那条推断的来源第 ③ 条是一条结构性红利不是调优技巧。它决定了同样的读一次输入、回答多个问题的需求因果底座天然能缓存、双向底座天生要重算。 所以 Jev 拿因果 Transformer 当底座不是随手选的。五、改训练方式RLHF 与推理模型ChatGPT 是 2022 年 11 月发布的对话产品此后从 GPT-3.5 一路更新到 GPT-4、GPT-4o、o 系列直到当前的 GPT-5.x。它的对话能力并非来自结构上的变化而是预训练之后的若干轮后训练。 2024 年之后的推理模型OpenAI o1、DeepSeek-R1同样没有改变架构而是通过强化学习让模型在给出答案之前先生成较长的思考过程。RLHF 做了什么以及它的代价RLHF 的做法是由人对模型的多个回答排序训练一个奖励模型去拟合人的偏好再以强化学习使模型输出向高奖励方向偏移。这使输出风格贴近标注者的偏好但代价是概率不再诚实。图 10 RLHF 把校准打坏了。这不是传闻——GPT-4 技术报告原文的图 8 就是这组对照预训练模型 ECE ≈ 0.007RLHF 后 ≈ 0.074约 10 倍恶化。[已核实]注意这张图对我们的意义不是RLHF 有问题而是为了对话体验概率的诚实性被牺牲掉了。 这正是 Jev 那套 RLCD 的立足点——它把校准本身当成优化目标。推理模型的思考过程本身仍是逐 token 的自回归生成只是不呈现给用户。它提高了数学、代码等可验证任务上的能力代价是单次回答的延迟从秒级提高到分钟级。六、改内部组件MoE 与 KV cache 压缩2026 年的两个开源模型是很好的观察样本9 月发布的 DeepSeek-V4.1-Flash 与 8 月开源的 Qwen3.8-27B。两者仍然是自回归、逐 token 生成的 Transformerprefill 与 decode 两阶段、后训练流程均原样适用。近几年的架构创新没有改变这一骨架而是集中在骨架内部的组件上目标基本一致在同等能力下降低计算量与显存占用。变化一前馈网络改为 MoE混合专家图 11 稠密与 MoE。DeepSeek-V4.1-Flash 总参数 552B、每 token 激活 16BQwen3.8-27B 则是 27B 全部激活的稠密模型。[已核实]变化二KV cache 的压缩长上下文与 agent 场景下缓存占用会超过权重本身。各家路径不同DeepSeek-V4.1-FlashQwen 线自 Qwen3-Next 起思路压缩缓存本身低维潜向量 稀疏选择 跨层复用换掉缓存用固定大小的状态替代逐 token 缓存具体做法CSA2Compressed Sparse Attention 2在层间复用 KV 与索引状态主 KV 用 FP4 存储另有 SWA Bounded Replay 处理 SSD/内存层每 4 层中的 3 层替换为 Gated DeltaNet 线性注意力第 4 层保留全注意力3:1 混合布局实测规模全局 KV 缓存压到 890 字节/token约为上一代的 1/4持久层约 1/8Qwen3-Next 48 层 36 层线性 12 层全注意力原生上下文 262K代价实现复杂度高压缩本身需要新的注意力模式调度固定状态对精确的远程检索能力弱于全注意力故必须保留部分全注意力层[已核实] DeepSeek 的因果 encoder-decoder是什么DeepSeek-V4.1-Flash 的 Causal Encoder-DecoderCED 把 40 层分成 20 层因果 encoder 20 层 decoderprefill 每 token 只激活约 8B 参数decode 约 16B——因为 agent 负载是输入重的省 prefill 才是省在大头上。但请注意这和第 2 节那个面向翻译的两段式结构含义完全不同。 它的 encoder 仍然是因果掩码的整个模型仍然是标准的自回归语言模型只是 decoder 层不再自己去算全局键值、而由前段投影得到。这也是文章那句提醒的由来判断路线看的是是否因果 是否逐 token 生成不是看名字。另外Qwen3.8-27B 本身是 27B 稠密Dense模型、原生多模态、262K 原生上下文YaRN 可外推至 1M量化后消费级显卡即可运行——它代表的是另一条思路不追参数规模而是把前沿能力蒸馏进可自部署的小模型。 [已核实]七、改输出方式Jev 与 LayaJev 为什么要另做一类模型TypeSafe AI 于 2026 年 9 月 15 日发布 Jev名字取自 William Stanley Jevons——越便宜的煤烧得越多寓意越便宜的智能会产生越多值得自动化的决策System One取自卡尼曼的快慢两种思考LLM 被归为慢的系统二。创始人的论证很直接RLHF 训练出来的模型从设计上就是为协助人而准备的——模型学会让回答看起来正确而不是让概率反映真实的正确率。TypeSafe 把自己的方法 RLCDReinforcement Learning for Calibrated Decisions与 RLHF、RLVR 并列为第三种后训练范式前两者分别优化人类偏好和可验证奖励RLCD 优化校准的决策。三种原语每次请求提供一段state待判断的材料可以是字符串、JSON 对象或数组再附上任意数量的问题。问题限定为三种原语原语问题类型返回示例Choice从最多 255 个选项中选一个各选项的概率 一个置信度这张工单应交给哪个团队Score在 2–10 个有序等级中评级概率加权的分数客户的不满程度Noul判断一个陈述是否成立一个 0–1 的概率这条消息是否紧急官方指标多数查询约 100 毫秒官方口径 70–500ms同一请求内增加问题几乎不增加延迟每百万输入 token $0.042输出免费仅支持文本英语为主不开源。注意这些数字均为 TypeSafe 自报用自家 benchmark 与自家对比未经独立验证——社区评测也指出不会幻觉实际含义只是不可能返回格式错误的结果它仍然可以自信地答错。它和 JSON mode 差在哪这是全文最容易被误解的一处Jev 很可能以预训练的 Transformer 作为底层网络它能理解任意自然语言问题的能力就来自这里这一部分与 LLM 同源。不同的是结果的产生方式。LLM 无论输出普通文本还是 JSON都要经过 decode 阶段逐 token 生成再由调用方解析字符串Jev 在 prefill 之后不进入 decode而是直接从网络中读出每个问题在各选项上的概率分布。这与给 LLM 加强制 schemaJSON mode、structured output 之类不是一回事后者只是约束了生成出来的字符串的格式逐 token 生成的过程一步没少前者根本没有生成过程。发布文章把这一区别写作串行采样与并行采样所谓类型安全也由此而来输出被限定在给定选项上不可能出现选项之外的内容。另一个参照是第三节那个 BERT 分类器。两者计算形态最接近都是读取输入一次、直接给出类别概率。区别在任务怎么指定BERT 分类器的任务在微调时写进参数类别固定Jev 的问题与选项是请求的一部分调用时用自然语言写出。这种通用性来自 LLM 级的底层网络——这一点第三章已经讲过差的是底座那层理解能力跟选项放输入还是放参数无关。Jev 的内部推断[推断] 以下不是官方信息官方没有公开架构只有新的模型架构、并行采样器、RLCD 训练方法几句。但从 API 的行为可以推断它的形态同一请求里增加问题数量几乎不增加耗时 → state 只读取一次、各问题并行处理255 个选项与 2 个选项耗时相同 → 没有逐 token 解码选项的位置会影响准确率 → 符合因果 Transformer 的特征。较可能的实现是以预训练的因果 Transformer 为底层网络对 state 做一次 prefill各问题连同选项作为并行分支同时前向在每个选项末尾读出分数、对同一问题的选项做 softmax并用合成数据训练概率的校准度。官方所称的新架构更可能指这套分支 读出头 训练目标的组合而不是新的注意力机制。Laya一个诚实的数据对照Jev 发布三天后的 9 月 18 日Convai Innovations 的 Nandakishor M 以 Apache 2.0 开源了 Laya定位是33 毫秒的开源 System 1 决策引擎社区普遍称之为开源版的 Jev。它的底层网络是公开的ModernBERT-large一个 4.21 亿参数的双向 encoder即 Encoder-only 路线的当代版本。它的结构可以从开源代码直接读出每个问题拼成一条序列——问题类型和指令在前各个选项在中间每个选项前放一个[MASK]标记state 接在最后。序列经过 encoder 和决策头后在每个[MASK]位置取出隐向量打分对同一问题的所有选项做 softmax。三种原语与 Jev 相同训练目标同样是概率的校准。发布版本给出的概率整体偏高作者建议使用者先在自己的数据上做一次校准再依据概率做决策。[核查后补充] 原文没说的Laya 并非全面落后原文的落点是同样的输出方式装在 4 亿参数的 BERT 上零样本判断的表现远不及 Jev。这个判断对底座零样本是成立的——Laya 的底座 checkpoint 在 typed-decisions 任务上不微调时接近随机。但第三方整理的数据给出了更完整的画面同一测试集 17,416 题单张 T4任务Jev 1.13.0Laya路由后谁更好typed-decisions2,000 题0.7270.766Laya 3.9AG News4 类0.9100.950Laya 4.0DAIR Emotion6 类0.4800.595Laya 11.5Banking7772 vs 77 个选项0.8700.425Jev 44.5ECE 校准误差越低越好0.2460.081Laya 好约 3 倍单问题延迟T4236–276 ms32.8 msLaya 快 7–8 倍这组数字要打的折扣① Jev 的数字来自第三方 benchmark不是与 Laya 的正面对拍② Laya 的优势成绩部分来自针对评测集微调后的 checkpoint而它自己的底座零样本接近随机③ 双方都比对自己擅长的那一类。所以不要把这组表读成Laya 赢了。它真正说明的是文章那个结论的边界在哪在选项数中等约 25 个以内的判别任务上4 亿参数配上专门训练就够了一旦选项数上去50零样本理解能力的差距立刻暴露——Banking77 上差 44 个点。还有一个数据点值得单独拎出来Laya 的 4.21 亿参数版是一个人用一张 RTX 6000 Pro96GB训出来的单次前向约 35 毫秒。 这个成本量级恰好印证了那句话——读出方式一次前向读概率不难4 亿参数 单卡就能实现难的是读出方式之下那层零样本读懂任意问题的理解能力。Laya 还额外提供了 3.22 亿参数的mmBERT-base多语言版本覆盖 100 语言和一个内置路由器按输入语种自动分发同时诚实标注了自己的边界底座零样本接近随机、选项超过 50 个准确率骤降、有序打分是最弱的一项、英文版对非拉丁文字会失效。它开源三天在 GitHub 上拿到 6,700 star也说明开发者对快速决策层这个位置确实有需求。所以 Jev 的定位它没有引入新的 Transformer 结构而是把向语言模型提选择题、只读概率不让它生成这种长期以 hack 形式存在的用法做成了产品并把概率的校准作为训练目标——这两件事恰好是面向对话的 LLM 长期不在意的。官方的独立评测都显示在拆分好的判断类任务上它的准确率与中等推理预算的前沿模型相当成本与延迟低约两个数量级同时在不熟悉的领域概率会失准也不能做数值计算和多步推理。它保留了 LLM 的理解能力去掉了生成因此不能写、不能思考、不能作为 agent 运行换来的是百毫秒级的延迟和可以直接用于程序判断的概率。一句话概括这个位置Jev 不是 LLM 的替代而是同一底层网络在另一类任务上的另一种用法。是否适用取决于你的任务需要的是自由的文本生成还是在有限选项之间做出判断。八、结语九年只改了三件事回到开头的问题。从 Transformer 到今天主流模型的骨架没有变过ChatGPT 与推理模型改变的是训练方式DeepSeek 与 Qwen 改变的是内部组件Jev 保留了这套骨架的读取部分和 LLM 级的理解能力去掉了生成部分。而 Laya 的对照说明了一件很值得记住的事去掉生成这一步本身并不难难的仍是底层网络的理解能力。最后留一条判据判断一个模型属于哪条路线看名字没用只看两点① 注意力是不是因果掩码② 结果是不是逐 token 生成出来的。 把这九个模型往里套一个都不会错。附录事实核查清单本文对原文涉及的关键事实做了一轮联网核对结果如下。事项核查结果Wang 等 2022 年的架构/目标对比结论准确 arXiv:2204.058322022-04-12BigScience6 个 5B 模型、168B token、30 个任务GPT-4 后训练导致校准性下降准确可补数字 技术报告图 8预训练 ECE ≈ 0.007 → RLHF 后 ≈ 0.074约 10 倍ModernBERT 是 Encoder-only 的当代版本准确 2024 年 12 月Answer.AI LightOnbase 149M / large 395MDeepSeek-V4.1-Flash 的总参数与激活参数准确并更精确 552B MoEdecode 激活 16B、prefill 只激活 8BKV 压到 890 字节/tokenQwen3.8-27B 是稠密模型准确 2026-08-14 开源27B 全激活、原生多模态、262K 上下文Laya 是 BERT 分类器往前走一步表述含糊 encoder 自 2019 年起zero-shot NLI 分类就能把选项写进输入真差别在底座理解能力见第三章Laya 零样本远不及 Jev不完整 底座零样本确实接近随机但微调版在多个任务上反超且校准误差好约 3 倍崩点在 50 选项Jev 的架构官方未公开 文中所有内部机制描述均标注为推断参考来源l3yx《从 Transformer 到 Jev —— 大模型架构的演进》淚笑的赛博日记-起零衍迹实验室2026-09-22。Vaswani et al., Attention Is All You Need, 2017.Thomas Wang et al., What Language Model Architecture and Pretraining Objective Work Best for Zero-Shot Generalization?, arXiv:2204.05832, 2022.OpenAI, GPT-4 Technical Report, 2023图 8 校准对照。Wenpeng Yin, Jamaal Hay, Dan Roth, Benchmarking Zero-shot Text Classification: Datasets, Evaluation and Entailment Approach, EMNLP 2019.Answer.AI / LightOn, Finally, a Replacement for BERTModernBERT2024-12.Yang et al., Gated Delta Networks: Improving Mamba2 with Delta Rule, ICLR 2025, arXiv:2412.06464.DeepSeek-AI, DeepSeek-V4.1-Flash Technical ReportCausal Encoder-Decoder / CSA2 / FP4 KV。TypeSafe AI, Introducing System One Models Jev2026-09-15.Convai Innovations / Nandakishor M, LayaApache 2.0ModernBERT-large2026-09-18。说明文中标注 [已核实] 的为联网核对过的公开事实标注 [推断] 的为基于 API 行为或架构设计的推测非官方信息。Jev 的具体架构官方从未公开请勿当作事实引用。

相关推荐

《从算力能源各玩各的到全套跑通:算电协同 + Token 全栈方案落地实战》
《从算力能源各玩各的到全套跑通:算电协同 + Token 全栈方案落地实战》

从三流割裂到生态闭环:算电协同Token价值全栈解决方案落地实战 锚定数字经济绿色低碳双赛道,拆解算力基建/算电协同/价值流通三层完整架构数字经济与绿色低碳,是当下确定性最高的两大赛道。但落地层面始终逃不开一个尴尬现状:概念… · 2026/9/27 22:58:08

我给自己 5 个网站做了一次 SEO 体检,发现新手站最常见的 6 个“隐形坑“
我给自己 5 个网站做了一次 SEO 体检,发现新手站最常见的 6 个“隐形坑“

前言 我手上有 5 个站:一个 40 多万页的词典站、一个 3 万多页的文案站、一个 4 万多页的查询站、一个日历站和一个在线工具站。前四个是"老站",最后一个工具站是刚上线的。 自以为老站该做的都做了,直到我用一个下午逐项实测&am… · 2026/9/27 22:58:08

搞懂wordpress顶部是什么及性能优化避坑指南
搞懂wordpress顶部是什么及性能优化避坑指南

搞懂wordpress顶部是什么及性能优化避坑指南 域名解析不通,服务器报错502,这是无数新手站长深夜崩溃的真实写照。你明明买好了空间,上传了文件,为什么浏览器打开就是一堆乱码或者空白页?很多时候,问题不出在代码逻辑,而出在你没搞懂… · 2026/9/27 22:58:02

QwenImageEdit与ComfyUI搭建人物一致性写真工作流
QwenImageEdit与ComfyUI搭建人物一致性写真工作流

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 23:29:29

深入I2C多主机仲裁与时钟延展:从原理到实战避坑
深入I2C多主机仲裁与时钟延展:从原理到实战避坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 23:29:23

组态王与MCGS的Modbus TCP实战避坑指南
组态王与MCGS的Modbus TCP实战避坑指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 23:29:23

运算跨导放大器OTA:原理、电路设计与gm-C滤波器应用
运算跨导放大器OTA:原理、电路设计与gm-C滤波器应用

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 23:29:23

储能CCS组件中FPC设计全解析:从电气布线到量产可靠性的关键要点
储能CCS组件中FPC设计全解析:从电气布线到量产可靠性的关键要点

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 23:29:17

汽车总线工具VBA安装实战指南:CANoe/CANalyzer自动化开发起点
汽车总线工具VBA安装实战指南:CANoe/CANalyzer自动化开发起点

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 23:29:17

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码