一、什么是LLMLLMLarge Language Model大语言模型 是一种基于海量文本数据训练的神经网络模型。LLM 的核心任务就是根据前面的内容预测下一个词是什么。输入我爱LLM 计算下一个词的概率 你 →30% 学习 →25% 吃 →15% 中国 →10%... 然后选一个比如学习拼上去 变成我爱学习再预测下一个词 编程 →20% 知识 →18%... 继续拼直到生成完整句子从而具备语言理解、生成、推理等能力。所有能力——翻译、写作、编程、推理——都是这个简单目标在大规模数据下的副产品。特征说明大规模参数量从数十亿到数万亿通用性一个模型可处理多种任务无需为每个任务单独训练涌现能力规模达到一定程度后出现小模型没有的能力如推理、代码自回归逐token生成每次基于前文预测下一个预训练微调先通用预训练再针对任务适配二、整体分层图┌─────────────────────────────────────────────────────┐ │ 第6层应用层 │ │ Chatbot / 知识助手 / Agent / API │ ├─────────────────────────────────────────────────────┤ │ 第5层增强层 │ │ Prompt / RAG / Agent / 工具 / 记忆 │ ├─────────────────────────────────────────────────────┤ │ 第4层推理层 │ │ 解码 / KV Cache / 量化 / 批处理 │ ├─────────────────────────────────────────────────────┤ │ 第3层模型层 │ │ Transformer分词→嵌入→注意力→FFN→输出 │ ├─────────────────────────────────────────────────────┤ │ 第2层训练层 │ │ 预训练 → SFT → 对齐 → 微调 │ ├─────────────────────────────────────────────────────┤ │ 第1层数据层 │ │ 训练数据 / 向量库 / 知识库 │ ├─────────────────────────────────────────────────────┤ │ 第0层基础设施层 │ │ GPU / 分布式 / 推理引擎 / 监控 / 安全 │ └─────────────────────────────────────────────────────┘ 贯穿评估与安全一句话理解每层第 0 层地基算力第 1 层燃料数据第 2 层学习训练第 3 层大脑模型第 4 层加速推理第 5 层外挂增强第 6 层产品应用第 0 层基础设施层支撑整个 LLM 系统运行的底层硬件和软件。就像盖楼需要地基LLM 需要算力。┌─────────────────────────────────────┐ │ 基础设施层 │ ├─────────────────────────────────────┤ │ 硬件 │ │ GPU/TPU 集群算力核心 │ │ 高速网络设备间通信 │ │ 存储模型和数据 │ ├─────────────────────────────────────┤ │ 软件 │ │ 分布式训练框架 │ │ 推理引擎 │ │ 容器编排 │ ├─────────────────────────────────────┤ │ 运维 │ │ 监控 / 日志 / 安全 / 限流 │ └─────────────────────────────────────┘作用提供算力训练和推理都要支撑分布式协同保证服务稳定和安全第 1 层数据层LLM 的燃料。没有数据模型什么也学不到。┌─────────────────────────────────────┐ │ 数据层 │ ├─────────────────────────────────────┤ │ 训练数据喂给模型学的 │ │ 网页 / 书籍 / 代码 / 论文 / 对话 │ ├─────────────────────────────────────┤ │ 运行时数据模型工作时用的 │ │ 向量库 / 知识库 / 缓存 / 会话 │ ├─────────────────────────────────────┤ │ 数据处理 │ │ 清洗 / 去重 / 分词 / 嵌入 / 索引 │ └─────────────────────────────────────┘作用训练时提供学习材料推理时提供外部知识RAG 用缓存加速重复请求第 2 层训练层把随机初始化的神经网络变成能听懂人话的智能助手的过程。┌─────────────────────────────────────┐ │ 训练层 │ ├─────────────────────────────────────┤ │ 阶段1预训练 │ │ 数据海量文本 │ │ 目标预测下一个词 │ │ 结果基础模型有知识不听话 │ ├─────────────────────────────────────┤ │ 阶段2监督微调SFT │ │ 数据指令-回答对 │ │ 目标学会听话 │ │ 结果指令模型会听话可能有害│ ├─────────────────────────────────────┤ │ 阶段3对齐RLHF/DPO │ │ 数据人类偏好 │ │ 目标符合人类价值观 │ │ 结果对齐模型有用、诚实、无害│ ├─────────────────────────────────────┤ │ 可选微调LoRA 等 │ │ 适配特定领域成本低 │ └─────────────────────────────────────┘作用预训练获得基础能力语言、知识SFT学会听指令对齐学会做好人微调适配特定领域第 3 层模型层核心LLM 的大脑是 Transformer 架构的具体实现。所有智能都在这里产生。┌─────────────────────────────────────────────┐ │ 模型层 │ ├─────────────────────────────────────────────┤ │ ① 输入处理 │ │ Tokenization分词→ 文本变 token │ │ Embedding嵌入→ token 变向量 │ │ Positional Encoding位置编码→ 加顺序 │ ├─────────────────────────────────────────────┤ │ ② Transformer Block × N核心 │ │ ┌─────────────────────────────────┐ │ │ │ LayerNorm归一化 │ │ │ │ ↓ │ │ │ │ Multi-Head Self-Attention │ │ │ │ 让每个词看其他词 │ │ │ │ ↓ │ │ │ │ Residual Add残差相加 │ │ │ │ ↓ │ │ │ │ LayerNorm │ │ │ │ ↓ │ │ │ │ Feed-Forward Network │ │ │ │ 加工信息 │ │ │ │ ↓ │ │ │ │ Residual Add │ │ │ └─────────────────────────────────┘ │ ├─────────────────────────────────────────────┤ │ ③ 输出层 │ │ Linear → Softmax → 概率分布 │ └─────────────────────────────────────────────┘作用理解输入把文字变成模型能算的向量计算上下文通过注意力理解词与词的关系加工信息通过 FFN 提取特征预测下一个词输出概率分布第 4 层推理层模型训练好后如何又快又省地生成输出。训练是一次性的推理是天天用的。┌─────────────────────────────────────┐ │ 推理层 │ ├─────────────────────────────────────┤ │ 解码策略怎么选词 │ │ 贪心 / 束搜索 / 温度 / Top-k / Top-p│ ├─────────────────────────────────────┤ │ 加速技术怎么更快 │ │ KV Cache / 量化 / 批处理 / 投机解码│ ├─────────────────────────────────────┤ │ 服务优化怎么服务更多人 │ │ PagedAttention / 连续批处理 / 路由 │ └─────────────────────────────────────┘作用控制输出质量温度、Top-p 决定创意还是严谨加速推理KV Cache、量化降低显存量化、GQA提高吞吐批处理、调度第 5 层增强层弥补 LLM 的局限扩展它的能力边界。这是应用落地最关键的一层。┌─────────────────────────────────────┐ │ 增强层 │ ├─────────────────────────────────────┤ │ Prompt 工程怎么问 │ │ 示例 / 思维链 / 角色设定 │ ├─────────────────────────────────────┤ │ RAG 检索增强补知识 │ │ 查资料 → 塞进上下文 → 再回答 │ ├─────────────────────────────────────┤ │ Agent 编排会做事 │ │ 规划 → 调工具 → 多步执行 │ ├─────────────────────────────────────┤ │ 记忆机制记得住 │ │ 短期 / 长期记忆 │ ├─────────────────────────────────────┤ │ 工具调用能动手 │ │ 调 API / 查数据库 / 执行代码 │ └─────────────────────────────────────┘作用对应解决 LLM 的局限LLM 局限 增强层方案幻觉 RAG 检索真实资料知识截止 RAG 补充最新信息无法做事 Agent 工具调用多步任务 Agent 规划无记忆 记忆机制输出不可控 Prompt 护栏第 6 层应用层最终面向用户的产品和服务。用户看到的就是这一层。┌─────────────────────────────────────┐ │ 应用层 │ ├─────────────────────────────────────┤ │ 对话类Chatbot / 客服 / 角色扮演 │ │ 知识类知识助手 / 文档问答 / 搜索 │ │ 创作类写作 / 翻译 / 代码生成 │ │ 自动化Agent / 工作流 / RPA │ │ 平台类API 服务 / 模型市场 │ └─────────────────────────────────────┘作用解决用户实际问题提供价值商业化贯穿层评估与安全不单独成层但贯穿所有层保证系统可靠、安全、持续改进。┌─────────────────────────────────────┐ │ 评估与安全贯穿 │ ├─────────────────────────────────────┤ │ 评估Benchmark / LLM-as-Judge / 人工│ │ 安全内容过滤 / 越狱防御 / 隐私 │ │ 对齐RLHF / DPO / 宪法 AI │ │ 可解释注意力 / 探针 / 知识编辑 │ └─────────────────────────────────────┘作用衡量效果好不好发现风险持续改进四、LLM 分层协同分层是逻辑划分协同是运行时行为。不同场景调用不同层复杂场景有循环和并行但核心始终是 L3模型 L4推理L5增强负责扩展能力L1数据提供外部知识L0基础设施全程支撑L2训练只在训练时参与。场景 1简单问答无 RAG、无工具典型用户问什么是 Java 的多态特点最简流程模型直接回答不查外部资料。 用户提问 │ ▼ 【L6 应用层】接收请求 │ ▼ 【L5 增强层】Prompt 组装 │ 系统提示 用户问题 ▼ 【L3 模型层】LLM 前向计算 │ ← 依赖【L0 基础设施】 ▼ 【L4 推理层】解码生成 │ ← KV Cache、采样 ▼ 【L5 增强层】输出后处理可选 │ ▼ 【L6 应用层】返回用户场景 2RAG 知识问答典型用户问我们公司上季度的销售政策是什么特点需要检索企业知识库把资料塞进上下文再回答。 用户提问 │ ▼ 【L6 应用层】接收 │ ▼ 【L5 增强层】查询改写 │上季度销售政策→2024Q4 销售政策 华东区▼ 【L5 增强层】检索请求 │ ▼ 【L1 数据层】向量检索 │ 向量库语义召回 Top-K │ 关键词BM25 召回 │ ⚡ 混合检索 ▼ 【L5 增强层】重排序 │ Cross-Encoder 精排 ▼ 【L5 增强层】上下文组装 │ 拼接系统提示 检索资料 用户问题 ▼ 【L3 模型层】LLM 生成 │ ← 基于真实资料减少幻觉 ▼ 【L4 推理层】解码 │ ▼ 【L5 增强层】引用溯源 │ 标注答案来自哪段资料 ▼ 【L6 应用层】返回带引用的答案场景 3流式对话典型ChatGPT 逐字输出。 特点边生成边返回用户体验好。 用户提问 │ ▼ 【L6】接收 │ ▼ 【L5】Prompt 组装 │ ▼ 【L3】LLM 开始计算 │ ▼ 【L4】解码第1个 token │ ↓ 立即推送 ▼ 【L6】显示第1个字 │ ▼ 【L4】解码第2个 token │ ↓ 立即推送 ▼ 【L6】显示第2个字 │ ▼... 循环 ⟲... │ ▼ 【L4】遇到结束符 │ ▼ 【L6】输出完成五、LLM 不能做什么局限说明例子幻觉会编造看似合理但错误的内容编造不存在的论文知识截止训练数据有时间限制不知道昨天发生的事上下文有限一次只能看有限长度超长文档看不完数学弱概率模型不擅长精确计算大数乘法容易错无法实时不能主动获取新信息需 RAG 或工具可能有害对齐不完美被越狱后说错话不确定不知道自己不知道不会说我不确定谄媚倾向于迎合用户你说错它也附和这些局限正是增强层要解决的问题。
企业数字化 ERP 产品动态
相关推荐
端侧AI算力设计:从场景约束反推真实需求 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 11:57:11
jenkins使用docker加载maven配置文件conf挂载和本地仓库repository挂载 增加:
args: -v mvn-conf:/usr/share/maven/conf withDockerContainer(args: -v mvn-conf:/usr/share/maven/conf,image: maven:3.8.6-openjdk-18-slim) {sh pwdsh ls -alsh mvn clean package}docker volume lsdocker inspect mvn-conf进入到该目录修改中央仓库地址… · 2026/9/24 11:57:11
三相全桥MOSFET布局与死区时间:无刷电机驱动硬件设计避坑指南 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 11:56:58
Halcon九点标定手眼标定全流程:从原理到实战避坑指南 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 12:28:06
FT232R驱动安装全攻略:Windows/Linux/macOS配置与问题排查 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 12:28:06
ResNet工业异常检测实战:多尺度特征提取与评分方案 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 12:27:54
LTPI协议详解:基于LVDS的板间低速信号隧道传输机制 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 12:27:42
AI不是互联网的升级 当下关于AI的讨论,最偷懒的框架是“AI是下一代互联网”。这个类比直观,但危险,因为它把两种完全不同的经济逻辑混在一起。传统互联网的成立,依赖一条关键成本曲线:初期资本开支大,用户规模扩大后边际成本快… · 2026/9/24 12:27:42
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程 简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为… · 2026/9/24 0:00:13
1D-CNN时间序列建模实战:从Conv1d原理到工业落地 简介:面向时间序列数据建模的一维卷积神经网络完整实现,适合深度学习入门者及需要快速验证时序模型的研究者,能够从音频、文本、传感器或股价等序列中挖掘局部特征与时间依赖。压缩包体积很小,只有3KB,内含3个Python脚… · 2026/9/24 0:00:26
柔软的L:汉语语流中被忽视的舌肌张力控制 1. 这个“L”不是字母表里的L,而是舌尖上的L最近在几个方言群和语音教学社群里,反复看到有人发一句:“也说字母L:柔软的长舌”。初看以为是英语发音课笔记,点开才发现全是方言爱好者、播音系学生、语言康复师甚至戏曲演… · 2026/9/24 0:00:44