1. 本章目标目标是解决多轮 LLM 对话中的核心问题Chat History 会不断增长而模型的 Context Window 是有限的。因此后端需要完成多轮聊天 ↓ Token 统计 ↓ 判断是否超限 ↓ 历史裁剪 ↓ 旧对话总结 ↓ Summary 压缩 ↓ 重新构造 Context ↓ 保证最终输入处于 Token Budget 内2. Token / Token ID / Embedding三者不能混淆。Text ↓ Tokenizer ↓ Token ↓ Token ID ↓ Embedding Layer ↓ Vector ↓ TransformerTokenToken 是 tokenizer 对文本进行切分后得到的离散单位。它不是向量。例如I love AI ↓ [I, love, AI]Token ID每个 token 会对应一个整数编号[I, love, AI] ↓ [40, 3021, 15592]EmbeddingToken ID 再经过 Embedding Layer40 ↓ [0.12, -0.34, 0.88, ...]这里才真正变成向量。3. Context WindowContext Window 可以理解成模型单次调用能够处理的 Token 总预算。通常需要考虑System Prompt Conversation History RAG Documents Current User Query Model Output因此Input Tokens Output Tokens Context Window不能把全部 Context Window 都分给输入。例如Context Window 8000 Input Budget 7000 Output Reserve 10004. Token Estimate学习阶段使用简单近似def estimate_tokens(text: str) - int: return max(1, len(text) // 4)注意这只是粗略估算。真实项目应该使用具体模型对应的 tokenizer。5. 统计整个 Contextdef count_message_tokens( messages: list[dict] ) - int: total_tokens 0 for message in messages: total_tokens estimate_tokens( message[content] ) return total_tokens逻辑message 1 → token message 2 → token message 3 → token ... ↓ total_tokens6. Message-based Trimming最简单的 Context Management始终保留 System Prompt 只保留最近 N 条消息例如def trim_messages( messages: list[dict], max_messages: int ) - list[dict]: if not messages: return [] if max_messages 0: return [] system_message messages[0] if max_messages 1: return [system_message] recent_messages messages[1:][-(max_messages - 1):] return [ system_message, *recent_messages ]缺陷消息数量 ≠ Token 数量一条消息可能只有OK也可能是一篇 5000 字文章。所以进一步进入 Token-based Trimming。7. Token-based Trimming目标System Prompt 永远保留 从最近的消息开始向前选择 直到达到 Token Budget核心for message in reversed(messages[1:]):因为最近的聊天通常比很早以前的聊天更加重要。选完以后selected.reverse()恢复正常时间顺序。8. Conversation Summary直接删除旧历史会造成信息永久丢失。因此可以Old History ↓ LLM Summarization ↓ Conversation Summary最终 ContextSystem Prompt Conversation Summary Recent Messages这样可以用更少 Token 保留更早的重要信息。9. messages_to_text()LLM 做总结之前需要把list[dict]转换成文本def messages_to_text( old_messages: list[dict] ) - str: return \n.join( f{message[role]}: {message[content]} for message in old_messages )这里组合了Generator Expression join()例如[ {role: user, content: What is RAG?}, {role: assistant, content: RAG combines retrieval and generation.} ]变成user: What is RAG? assistant: RAG combines retrieval and generation.10. summarize_messages()旧聊天通过 LLM 转换成 Summaryold_messages ↓ messages_to_text() ↓ summary prompt ↓ LLMClient.chat() ↓ result[answer] ↓ summary总结时应保留Important factsUser goalsDecisionsConstraintsUnresolved questionsSummary 的重点是信息保真而不是创造性。因此通常使用相对低的 temperature。11. build_context()将System Summary Recent Messages重新组合def build_context( system_message: dict, summary: str, recent_messages: list[dict] ) - list[dict]: summary_message { role: system, content: fConversation summary: {summary} } return [ system_message, summary_message, *recent_messages ]12. Context Priority不是所有 Context 信息优先级都一样。可以建立Priority 1 System Prompt Priority 2 Current User Query Priority 3 Conversation Summary Priority 4 Recent History Priority 5 Very Old History未来加入 RAGSystem Prompt Conversation Summary Recent History Retrieved Documents Current Query这就是Context Budget Allocation13. Summary Compression如果System Summary本身已经超过预算那么删除 Recent History 也没有意义。这时应该Summary ↓ 再压缩 ↓ 更短 Summary但不能无限循环。应该使用Bounded Retry例如MAX_SUMMARY_RETRIES 2最多尝试 2 次。如果仍然超限raise ContextOverflowError(...)14. 为什么不能无限总结无限循环可能产生无限 API 调用无限费用延迟不断增加Summary 信息持续丢失Summary 不一定越来越短程序可能无法终止因此真实工程要求压缩 ↓ 有限次数 ↓ 重新检查 ↓ 仍然失败 ↓ Fallback / Error15. Responsibility Separation这一章很重要的软件设计思想trim_context()只负责在固定 Context 合法的情况下 尽量保留 Recent Historysummarize_messages()只负责Messages → Summarycompress_summary()只负责Long Summary → Short Summaryprepare_context()负责整个流程检查 ↓ 拆分 ↓ 总结 ↓ 压缩 ↓ 裁剪 ↓ 异常处理也就是prepare_context() 是 Orchestrator / Controller。16. 本章最终架构messages │ ▼ prepare_context() │ Token Count │ ┌──────────┴──────────┐ │ │ 未超预算 超预算 │ │ return messages ▼ Split History │ ┌─────────────┴─────────────┐ ▼ ▼ old_messages recent_messages │ │ ▼ │ summarize_messages() │ │ │ ▼ │ summary │ │ │ ▼ │ fixed context │ system summary │ │ │ ▼ │ 是否超预算 │ / \ │ No Yes │ │ │ │ │ compress_summary() │ │ │ │ │ 最多 N 次 │ │ │ │ │ 仍然超预算 │ │ / \ │ │ No Yes │ │ │ │ │ │ │ Error │ │ │ │ └───────┴───────────────┐ ▼ trim_context() │ ▼ Final Context17. 本章涉及的 Python 知识本章实际上复习并组合了list dict slice reversed() reverse() for loop generator expression join() f-string function typing class exception async / await OOP LLMClient nested dict early return最大的提升不是又学了几个 Python 语法而是开始把多个函数组合成一个完整 AI Backend 子系统。18. 当前学习进度Python Fundamentals ✅ FastAPI / Pydantic ✅ Async HTTP / LLMClient ✅ LLM Messages ✅ Multi-turn Chat ✅ Context Management ✅ 本章完成 Structured Output ← 下一章 Tool Calling ⏳ Embedding ⏳ Vector Database ⏳ RAG ⏳ Agent ⏳ Production / Deployment ⏳下一阶段Structured Output → Tool Calling → RAG → Agent
企业数字化 ERP 产品动态
相关推荐
把论文段落顺序打乱,真的能降低AI率吗? 把论文段落顺序打乱,真的能降低AI率吗?
有人说,把段落顺序换一换,让文章“不那么有规律”,就能降低 AI 率。你可能已经把综述后半段搬到前面,或把解释段放在结论后面,检测数字却没有明显改善&a… · 2026/9/27 1:57:51
Zotero7安卓平板同步配置指南:WebDAV与插件实战 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 1:57:45
UVA-12265 贩卖土地 题解答案代码 算法竞赛入门经典第二版 GitHub - jzplp/aoapc-UVA-Answer: 算法竞赛入门经典 例题和习题答案 刘汝佳 第二版
虽然算法竞赛入门经典书中标的是两个星号,表示难度较高,但是从方法和代码量上来看,我觉得和两颗星的难度还差的比较远。当然或许是我直接看了书中的分析再… · 2026/9/27 1:57:45
BugKu——split_all 一、题目二、方法下载得到一张png图片,打开无显示。使用WinHex查看,发现其中又gif图片头部常有的字节。【常见图片格式文件头速查表】格式文件头(十六进制)ASCII 特征典型扩展名PNG89 50 4E 47 0D 0A 1A 0A.PNG.....pngJPEG/JPGFF… · 2026/9/27 2:35:28
3步搞定wordpress开启mu,小白避坑指南 3步搞定wordpress开启mu,小白避坑指南 很多老板想做网站,听到代码就头大。别怕,wordpress开启mu其实没那么玄乎。这份避坑指南专为不会代码的你准备。 1. 啥是MU插件?别被名字吓到… · 2026/9/27 2:35:22
仲夏CMS | 一套编辑器,全站通用 —— 编辑器功能与用法完全指南 ZXSORA CMS 功能介绍 2026-09-25一套编辑器,全站通用 —— 编辑器功能与用法完全指南覆盖 16 个模块的写作与互动入口 19 项功能 齿轮自定义 一键复原配图均为实测截取 全部于本地站点逐页验证,零脚本报错第一节它是什么博客、论坛、圈子、资讯、文… · 2026/9/27 2:35:22
揪出Flaky测试:TestSprite test flaky稳定性检测实战,10次重放给出稳定度评分 揪出Flaky测试:TestSprite test flaky稳定性检测实战,10次重放给出稳定度评分 【免费下载链接】testsprite-cli Official TestSprite CLI — AI-powered automated testing from your terminal 项目地址: https://gitcode.com/gh_mirrors/te/testsprit… · 2026/9/27 2:35:16
做新媒体的小说网站实战案例:搞定备案不头疼 做新媒体的小说网站实战案例:搞定备案不头疼 备案号还没下来,服务器就被运营商断网,这种憋屈事你遇到过吗?做新媒体的小说网站,最让人头大的往往不是代码写不出来,而是备案流程一头雾水。我见过太多创业者,站点做得花里胡哨,结果卡在工信部ICP备案… · 2026/9/27 2:35:04
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现 简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01
汕头网站建设制作厂家避坑指南:5大注意事项救急 汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习 简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现 简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01
汕头网站建设制作厂家避坑指南:5大注意事项救急 汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习 简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01