1.模型1.1大语言模型LLM大语言模型擅长做的事情理解自然语言并生成自然语言。典型能力包括总结一段文字翻译一段文本改写、润色、扩写内容根据描述生成代码这些任务的共同点输入是文本输出也是文本。1.2多模态模型多模态模型是在大语言模型的基础上能力进一步扩展的一类模型。除文本外该类模型还可以理解/生成图片音频视频注意多模态≠更聪明多模态的本质含义是模型能处理的输入和输出形式变多了而不是它在逻辑推理或判断能力上发生了质变。它解决的是“能不能看、能不能听、能不能画”而不是“该不该做、下一步做什么”。1.3向量模型向量模型不负责生成内容。向量模型的输出是一组数字向量这组数字的意思一段文本在语义空间中的位置两段内容在语义层面上有多相似因此向量模型通常被用在一些“幕后但关键”的场景中搜索推荐聚类RAG(索引增强生成2.Agent智能体Agent 就是你只管说要达成什么目标它能自己想办法拆解步骤、调用工具、灵活调整自主把事情办好的智能系统。最近流行的OpenCode、Codex、Trae、CursorAgent模式等都是Agent。2.1Agent和模型的关系大模型是 “大脑”Agent 是 “有手有脚有记忆、会自己定计划干活的完整的人”人用大脑思考问题但人不等于大脑大脑也不会自己干活。2.2Agent和Workflow工作流的区别执行任务的过程中Workflow的整个执行流程是人为提前设计好的Agent则不需要人为设计好自动设计执行流程并对每一步流程有决策权。可以说Agent是目标驱动的自主决策系统自动化Workflow是预定义的流程化任务序列。同时Agent 可以调用 Workflow。2.3Agent Loop所有 AI Agent 干活的底层逻辑就是一个「思考判断→动手执行→再思考判断」的循环直到把目标事情做完才停下。因此可以把Agent的行为逻辑抽象成如下循环称为Agent Loopwhile(true){// 判断当前状态是否需要继续if(think()){execute();//执行动作(可能是调用工具、生成内容等)}else{break;//目标已完成或无需继续}}注意think()不是单纯 “想一句话”它是一整套「评估状态 判断进度 规划下一步」的决策过程execute()也不是只执行代码它泛指所有落地动作比如调用浏览器、读取文件、生成内容都算。这个循环的价值是把 Agent “自主做事” 这个模糊的过程拆成了标准化的「思考 - 执行」两步让整个过程可控、能监控。不管多复杂的 Agent 框架本质都是这个基础循环的升级版。3.Tool calling工具调用大模型本身有天然短板知识是训练时截止的不知道实时信息比如今天的天气、最新的股价只会生成文字不会实际操作比如跑代码、查文件、订机票不擅长精确计算比如复杂公式、大数据统计相当于一个脑子很聪明但没手没脚、出不了门、信息过时的人。而 tool calling 就是给它配了一整套工具和帮手需要的时候直接喊人干活。3.1Tool calling怎么干活对应之前的 Agent Looptool calling 就是execute()环节里最核心的动作先判断think 环节大模型先琢磨 “这个问题我自己能答吗要不要用工具用哪个要给它什么参数”发指令execute 环节按照固定格式发出调用请求比如 “调用天气工具查询城市 南昌日期 今天”收结果工具执行完把结果比如 “28℃晴”返回给大模型整答案大模型把工具返回的结果加工成通顺的人话回复给你3.2和 Agent 的关系没有 tool calling大模型就只能 “光说不练”有了 tool calling大模型才能长出 “手和脚”变成能真正做事的 Agent。4.MCPMCP 的全称是Model Context Protocol中文直译为「模型上下文协议」。MCP就是一套给 AI 模型和工具用的「通用对接标准」相当于统一了所有型号的 “充电接口”让不同的大模型和各种工具能直接互相连通不用挨个单独适配。可以这么理解MCP 就是 Agent 世界里的 Restful 规范都是用一套统一标准解决 “不同东西怎么互相说话” 的问题只是一个管 Web 服务对接一个管 AI 模型和Tool calling的对接。5.向量向量就是把一个东西的所有特征按固定顺序排成的一串数字计算机靠这串数字就能判断两个东西 “像不像”。比如我们用 3 个特征描述一个人身高cm、体重kg、年龄。张三[175, 70, 30]→ 这就是一个 3 维向量李四[176, 72, 31]→ 这是另一个 3 维向量这两串数字非常接近计算机就知道张三和李四的身形、年龄都很像。如果换成一个小学生的向量[140, 35, 10]数字差得很远计算机就知道这两个人差别很大。5.1语义向量我们聊 Agent、知识库、RAG 时说的向量是大模型把文字、图片、语音的「语义 / 内容特征」翻译成的一串数字通常有几百到几千位也就是几百到几千维。比如句子 A“今天南昌晴天温度 28 度”句子 B“南昌今日天气晴朗气温 28℃”这两句话用词不一样但意思几乎一样大模型生成的向量就会非常接近。计算机不用懂中文只要算一下两个向量的 “距离”就知道它们说的是一回事。5.2作用最核心的用处就是快速找相似内容向量检索是知识库、RAG 的基础比如你的 Agent 对接了 1000 份公司文档(知识库你问 “报销流程是什么”。先把你的问题转成向量去存着所有文档向量的向量库里找和问题向量最 “近” 的几个文档把找到的相关文档丢给大模型让它基于这些内容回答你不用一篇篇翻、不用一个个匹配关键词速度快、还能匹配到意思相同但用词不一样的内容这就是向量的核心价值。6.RAGRAG 的标准全称是Retrieval-Augmented Generation中文正式译名为「检索增强生成」。RAG 就是给大模型开卷考试的技术 —— 答题前先去指定资料里精准翻到相关内容再照着资料回答不会瞎编还能用上大模型本来不知道的信息。6.1为什么需要 RAG大模型本身的天然短板正好 RAG 都能补上知识有截止日期训练之后的新事它都不知道没见过你们公司内部的制度、项目文档、私有数据问了答不上来遇到不会的问题容易 “一本正经胡说八道”行业叫 “幻觉”而 RAG 相当于给它配了一套可随时翻阅的指定参考书答题不靠死记硬背靠现场查资料。6.2工作流程全程分三步核心就是用向量来 “找相似”建库提前做一次把所有要用到的资料文档、表格、聊天记录切成小段每一段转成一个向量全部存进向量数据库里 —— 相当于把参考书拆成一页一页每页做个数字标签摆到书架上。检索提问时做你提的问题先转成向量去向量库里比对找出和问题最相关的那几段内容 —— 相当于拿到考卷先去书架上翻出对应的几页书。生成最后一步把「找到的相关资料 你的问题」一起丢给大模型让它严格参考这些资料来组织答案 —— 相当于照着书里的内容答题不自己瞎编。7.SkillSkill是建立在Tool Calling之上的任务封装。它不提供新的执行能力而是定义了一套程序性知识为了完成某个具体任务应该按什么顺序、调用哪些工具、遵守什么规则。7.1举例“生成出门清单”就是一个Skill7.2Skill和System Prompt的区别主要区别就是skill是按需加载的但是system prompt是始终在场的。7.3 Skill、Tool Calling、Workflow的区别可以用一个比喻来理解它们的层次Tool Calling 是“手”提供最基础的物理动作能力抓取、移动。Skill 是“操作手册”告诉Agent“要拧螺丝就用螺丝刀顺时针转三圈”。Workflow 是“流水线图纸”规定了整条产线上哪个工位先做什么下一个工位再做什么。8.Agent工作流程总结给Agent输入文字、图片、音频或视频等任务信息。初始化Agent上下文进入Agent Loop加载System Prompt带上工具清单、MCP服务列表、Skill索引。System Prompt在这一步开始全局生效。think环节LLM负责评估进度、规划下一步或者多模态模型任务描述不仅仅有文字理解任务。同时根据任务描述匹配Skill如果命中某个Skill就加载对应 SKILL.md 或技能定义到上下文。Skill告诉Agent“这类任务具体怎么做、按什么顺序、用什么工具、有什么业务规则。”System Prompt始终约束think的边界不能越权、不能泄露隐私、不能乱承诺。若需内部私有资料则启动RAG通过向量模型将查询转为语义向量在向量库中匹配出相关内容补全信息execute环节通过Tool calling调用各类外部工具所有模型与工具均遵循MCP若需处理图文音视频内容时则调用多模态模型经过多轮循环迭代直到LLM判定目标达成便终止循环输出最终结果。
企业数字化 ERP 产品动态
相关推荐
MCP 协议深度解析:从原理到实践,用 TaoToken 统一 Key 低门槛接入 AI 工具 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 3:24:53
手写Java词法分析器:DFA状态机实现与工程实践 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 3:24:53
2026物联网开发公司TOP10:五大硬指标与四大技术趋势解析 1. 榜单背后:物联网开发公司真正的分水岭在哪每年到年底,圈内人都会讨论“明年哪家物联网公司能冲上来”。2026年的趋势判断其实早在2024年就已经埋下伏笔,AIoT融合进入深水区、边缘计算从概念变成刚需、平台型公司开始收缩战线聚焦垂直行业&… · 2026/9/26 3:24:47
在Python编程中,切片(Slicing)是一种极其强大且优雅的数据处理机制 在Python编程中,切片(Slicing)是一种极其强大且优雅的数据处理机制。它允许开发者通过简洁的语法,从序列类型(如列表、元组、字符串)中提取子序列。切片不仅是Python区别于其他编程语言(如C、Ja… · 2026/9/26 4:07:08
监控摄像头像素真相:不是数字游戏,而是光学与工程的平衡 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 4:07:08
概要设计说明书模板:模块划分、接口定义与评审避坑指南 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 4:07:08
车载测试从入门到进阶:V模型、adb命令与渗透测试实战解析 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 4:07:02
AI代理可观测性实战:OTel+OpenLit+Elastic全链路追踪 1. AI代理可观测性为什么成了绕不开的坎AI代理和传统后端服务有一个本质区别:它的执行路径不是确定性的。你给它一个输入,它可能调用三次工具、也可能调用十次;可能走检索增强生成(RAG)链路,也可能直接凭模… · 2026/9/26 4:07:02
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍 简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践 一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46