首页/新闻资讯/正文详情

Model-Optimizer Agent 工具链配置指南:共享指令、可安装 Skills 与本地覆盖机制

发布时间:2026/9/26 7:26:04 来源:云帆数科 栏目:资讯中心
Model-Optimizer Agent 工具链配置指南:共享指令、可安装 Skills 与本地覆盖机制
【免费下载链接】Model-OptimizerA unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.项目地址https://gitcode.com/GitHub_Trending/te/Model-Optimizer点击查看免费下载Model-Optimizer 不仅是一个面向 LLM 的量化、剪枝、蒸馏等模型优化统一库其仓库还内置了一套完整的 AI Agent 工具链.agents/目录与modelopt插件供 Claude Code、Codex 等编码代理在仓库内协作开发、量化、评测与部署。本文基于仓库维护文档 .agents/TOOLING.md并结合 .agents/README.md、plugins/modelopt/.claude-plugin/plugin.json 等源码配置系统讲解这套 Agent 设置的三大支柱共享指令Shared Instructions、可安装 SkillsInstallable Skills与本地覆盖Local Overrides。读完本文你将掌握如何在任意工作区安装并使用 Model-Optimizer 的 Agent Skills、如何为仓库级指令与个人级覆盖分层配置以及如何维护一个多 Agent 兼容的仓库协作环境。一、为什么需要 Agent 工具链配置Model-Optimizer 的日常开发与评测工作流高度依赖 AI 代理从 PTQ 量化配方搜索quant-recipe-search、模型部署deployment、评测运行evaluation、launching-evals到远端集群上的 SLURM 作业监控monitor每一步都有对应的 Skill 文件来约束代理的行为。这些指令如果直接写死在代理的系统提示里会带来两个问题可复用性差换一个工作区或换一个代理工具指令就要重新编写上下文膨胀代理每次运行都要加载全部指令token 成本随指令体积线性增长。为此Model-Optimizer 把 Agent 配置拆成三层仓库级共享指令、可安装/可移植的 Skills、以及仅对单个开发者生效的本地覆盖。三者由 .agents/TOOLING.md 统一约定再由 .agents/README.md 详细描述目录布局与各代理的发现机制。下面逐层展开。二、共享指令AGENTS.md 与 CLAUDE.md 的符号链接机制TOOLING.md第一条约定直指指令的单一事实来源Single Source of Truth更新AGENTS.md以维护仓库级 Agent 指令CLAUDE.md是AGENTS.md的符号链接因此对该文件的修改会同时作用于 Codex 与 Claude Code。也就是说AGENTS.md是唯一需要编辑的文件CLAUDE.md只是兼容入口。查看仓库根目录可以确认这一约定确实生效CLAUDE.md 与 AGENTS.md 同时存在而仓库级指令的全部内容都维护在AGENTS.md中。从 AGENTS.md 的实际内容可以看到这套共享指令覆盖了代理在仓库内工作的关键约束仓库定位Repository orientation先读README.md了解项目与安装方式源码在modelopt/、测试在tests/、用法示例在examples/或docs/Agent Skills 的规范树位于plugins/modelopt/skills/而.agents/skills与.claude/skills只是指向该规范树的相对符号链接编码规范开发与评审前必须阅读 CONTRIBUTING.md 中的 Coding Standards不得跳过迭代开发测试运行遵循CONTRIBUTING.md的「Writing and Running Tests」章节快速迭代时优先选择tests/中针对变更区域的聚焦测试提交纪律使用git commit -s -S签名提交未经当前轮次明确许可不得git push发布类操作push、gh pr create等必须先等待用户明确指示Skills 更新原则Skill 编辑要精简因为每行都会在每次使用时消耗代理上下文 token只添加能改变代理行为的内容优先压缩既有文本开 PR 前必须做最终压缩PR 规模控制每个待评审 PR 尽量控制在约 500 行变更以内超预算时先提议拆分按结构拆优先于按功能拆再用git diff --stat校验规模。这套约定说明了「共享指令」层的设计哲学它只承载跨工具、跨任务都成立的仓库规则把任务相关的领域知识全部下沉到 Skills 层从而控制上下文成本。三、可安装 Skillsmodelopt 插件与安装命令TOOLING.md的第二条约定modelopt插件将仓库的 Skills 打包供任意工作区使用安装命令见 README.md 的 AI Agents 章节。这意味着 Skills 不是只能在本仓库内使用而是可以像 VS Code 扩展一样安装到任何工作区。README 中给出的安装命令如下# Claude Code claude plugin marketplace add https://github.com/NVIDIA/Model-Optimizer.git claude plugin install modeloptmodelopt # Codex codex plugin marketplace add https://github.com/NVIDIA/Model-Optimizer.git安装完成后在 Codex 中打开/plugins选择modeloptmarketplace 并安装modelopt即可。对于仓库贡献者也可以跳过插件安装直接从本地检出checkout使用 Skills。3.1 插件与 Marketplace 清单支撑这套安装机制的配置文件有两份.agents/plugins/marketplace.json —— Codex 的 marketplace 清单声明插件名为modelopt、显示名为 NVIDIA Model Optimizer、来源为本地路径./plugins/modelopt并设置installation: AVAILABLE、authentication: ON_INSTALL的安装策略plugins/modelopt/.claude-plugin/plugin.json —— Claude Code 的插件清单除名称、版本0.1.0、描述涵盖 Model Optimizer 开发、量化、部署与评测的 Skills、关键字modelopt、quantization、evaluation、deployment、llm与 Apache-2.0 许可证外还内嵌了一个MCP 服务器配置mcpServers: { modelopt: { command: uvx, args: [ --from, githttps://github.com/NVIDIA/Model-Optimizer.git#subdirectorytools/mcp, modelopt-mcp ] } }也就是说安装modelopt插件后代理不仅能加载本地 Skills还能通过uvx启动仓库tools/mcp子目录下的modelopt-mcpMCP 服务器获得额外的工具能力。3.2 Skills 的目录组织与 SKILL.md 规范Skills 的规范树位于 plugins/modelopt/skills/每个 Skill 以skill-name/SKILL.md形式组织并附带references/、scripts/、tests/等支撑文件。从目录树可以看到完整的技能矩阵例如common/—— 共享支撑文件environment-setup.md、slurm-setup.md、remote-execution.md、credentials.md、workspace-management.md等ptq/—— 后训练量化含checkpoint-validation.md、launcher-guide.md、slurm-setup-ptq.md、unsupported-models.md等参考qad/、speculative-decoding/、quant-recipe-search/—— 量化感知蒸馏与投机解码相关deployment/—— 部署含references/benchmarking.md、trtllm.md、vllm.md、sglang.md、support-matrix.md与scripts/deploy.shevaluation/、launching-evals/、accessing-mlflow/、compare-results/、monitor/—— 评测与作业监控debug/、day0-release/、release-cherry-pick/等 —— 调试与发布流程。每个SKILL.md采用统一的 YAML frontmatter Markdown 正文结构。以 plugins/modelopt/skills/deployment/SKILL.md 为例--- name: deployment description: Serve a quantized or unquantized LLM checkpoint as an OpenAI-compatible API endpoint using vLLM, SGLang, or TRT-LLM. Use when user says deploy model, serve model, ... Do NOT use for quantizing models (use ptq) or evaluating accuracy (use evaluation). license: Apache-2.0 ---description字段会明确告诉代理何时该用、何时不该用这个 Skill例如部署任务应使用deployment而非ptq或evaluation这是代理在运行时正确路由到对应 Skill 的关键信号。正文则给出可直接执行的命令如$SKILL_DIR/scripts/deploy.sh start --model ./qwen3-0.6b-fp8 $SKILL_DIR/scripts/deploy.sh start --model ./llama-70b-nvfp4 --framework sglang --tp 4 $SKILL_DIR/scripts/deploy.sh test $SKILL_DIR/scripts/deploy.sh status $SKILL_DIR/scripts/deploy.sh stop3.3 多 Agent 的发现机制与符号链接约定不同代理发现 Skills 的机制各不相同.agents/README.md 的「How each agent finds these」给出了精确的兼容策略Claude Code只会在.claude/skills/下自动发现 Skills因此.claude/skills/存放指向.agents/skills/的相对符号链接仓库内代理使用.agents/skills指向插件的相对符号链接Claude Code 与 Codex 插件直接加载plugins/modelopt/skillsClaude Code 子代理通过插件从plugins/modelopt/agents/加载同时.claude/agents/*.md符号链接把子代理暴露给仓库用户参见modelopt-model-deployer、modelopt-model-quantizer、modelopt-model-evaluator、modelopt-model-performance-benchmarker、modelopt-model-quantize-recipe-searcher等角色定义Codex直接从.codex/agents/发现项目角色且 Codex 插件目前无法安装自定义角色。这套「永远不复制、只做符号链接」的设计保证了.agents/README.md中所说的编辑规则可以严格成立所有 Skills 一律在plugins/modelopt/skills/下编辑代理各自目录下的同名文件只是入口。Claude Code 子代理归属plugins/modelopt/agents/Codex 自定义角色归属.codex/agents/新 Skill 统一放到plugins/modelopt/skills/skill-name/SKILL.md共享支撑文件放在plugins/modelopt/skills/common/。3.4 上游 Skills 的同步机制仓库中存在两类 Skill自研 Skill 与「逐字转售vendored verbatim」的上游 Skill。后者由 .agents/scripts/sync-upstream-skills.sh 统一管理——该脚本以固定 SHA默认DEFAULT_SHA从NVIDIA-NeMo/Evaluator的packages/nemo-evaluator-launcher/.claude/skills拉取launching-evals与accessing-mlflow两个 Skill覆盖写入.agents/skills/兼容符号链接并自动在SKILL.mdfrontmatter 的description:之后注入来源与许可证行幂等操作。需要注意这些逐字转售的 Skill 禁止手工修改本地改动会在下次同步时被覆盖而evaluationSkill 是上游nel-assistant的修改版 fork不受该脚本管理上游更新时需要手动同步。日常使用方式为.agents/scripts/sync-upstream-skills.sh # 按固定 SHA 重新同步 UPSTREAM_SHAsha .agents/scripts/sync-upstream-skills.sh # 升级到新 SHA该脚本依赖gh、base64、awk工具且必须从仓库根目录运行。四、本地覆盖CLAUDE.local.md 与 AGENTS.override.mdTOOLING.md的第三条约定针对个人本地指令并强调两种代理的覆盖语义完全不同对于私有本地指令使用工具特定的覆盖文件Claude CodeCLAUDE.local.md是追加式的在CLAUDE.md之后被读取CodexAGENTS.override.md会替换同目录下的AGENTS.md因此它不是追加式的必须重述仍应生效的共享指令。代理工具覆盖文件语义注意事项Claude CodeCLAUDE.local.md追加additive在CLAUDE.md之后读取无需重述共享指令CodexAGENTS.override.md替换replace同目录下完全取代AGENTS.md必须重述仍要生效的共享指令这是全文最容易被忽略、却最容易踩坑的一条对 Claude Code 来说个人习惯配置可以增量叠加对 Codex 来说一旦出现AGENTS.override.md仓库级AGENTS.md就不再生效任何仍需保留的共享约束如签名提交、push 审批、PR 规模都必须显式写进 override 文件否则代理的行为约束会静默丢失。五、配套设施远端集群配置与 MCP 服务器除三大支柱外.agents/还承载两项与代理实际执行密切相关的配置远端集群配置。remote-execution、monitor、ptq、launching-evals等 Skill 在把任务提交到 GPU 工作站或 SLURM 集群时会按序查找clusters.yaml依次为~/.config/modelopt/clusters.yaml用户级推荐、repo-root/.agents/clusters.yaml项目级规范位置、repo-root/.claude/clusters.yaml项目级向后兼容。模板见 .agents/clusters.yaml.example其结构示例如下clusters: my-cluster: login_node: cluster-login.example.com user: myusername ssh_key: ~/.ssh/id_rsa workspace: /path/to/remote/workdir gpu_type: H100 # 用于量化格式推荐 # slurm: # default_account: my_account # default_partition: batch_short default_cluster: my-cluster其中gpu_type字段会被用于量化格式推荐例如 FP8 与 NVFP4 的选择slurm子块则为作业调度提供默认账户与分区。MCP 服务器。如前所述plugins/modelopt/.claude-plugin/plugin.json 通过uvx声明了modelopt-mcp服务器源码位于tools/mcp安装插件后代理即可访问由该服务器提供的额外工具例如accessing-mlflowSkill 所依赖的 MLflow 访问能力。六、总结一套可移植、可叠加、可维护的 Agent 配置体系回到 .agents/TOOLING.md 的定位——它是写给「维护仓库 Agent 设置的人类」的速查笔记而非每次加载的代理指令。它通过三条约定构建了完整的配置分层共享指令收敛到AGENTS.md单一事实来源CLAUDE.md符号链接保证 Claude Code 与 Codex 行为一致可安装 Skills由modelopt插件打包通过 marketplace/plugin 清单安装到任意工作区SKILL.md 的 frontmatter 驱动代理按需加载且与上游同步、仓库符号链接等机制共同保证「单一编辑点」本地覆盖严格区分追加式CLAUDE.local.md与替换式AGENTS.override.md避免个人配置污染仓库指令也避免替换语义导致共享约束被静默丢弃。对于想在 Model-Optimizer 仓库内开展量化、部署、评测工作的开发者或 Agent 维护者而言理解这三点就等于拿到了这套工具链的完整操作手册安装入口看 README.md目录与发现机制看 .agents/README.mdSkill 编辑规则与同步流程则遵循 AGENTS.md 与 .agents/scripts/sync-upstream-skills.sh。如果你需要在个人工作区保留私有配置请务必记住Claude Code 用追加Codex 用替换且必须重述共享指令。赞分享【免费下载链接】Model-OptimizerA unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.项目地址https://gitcode.com/GitHub_Trending/te/Model-Optimizer点击查看免费下载相关推荐《Bananas 屏幕共享工具安装与配置指南》《Bananas 屏幕共享工具安装与配置指南》 1. 项目基础介绍 Bananas 是一款跨平台的屏幕共享工具适用于 Mac、Windows 和 Linux音视频即时通讯【免费下载】 NVIDIA TensorRT Model Optimizer安装与配置指南NVIDIA TensorRT Model Optimizer安装与配置指南 1. 项目基础介绍 NVIDIA TensorRT Model OptimizerBananas屏幕共享工具完整安装与配置终极指南Bananas屏幕共享工具完整安装与配置终极指南 想要快速实现跨平台屏幕共享Bananas是你的理想选择这款基于TypeScript和Svelte构建的工具音视频即时通讯创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

iVentoy批量装系统:PXE网络启动原理与部署实战
iVentoy批量装系统:PXE网络启动原理与部署实战

1. 为什么一根网线就能给几十台机器装系统第一次接触批量装系统的场景,多半是这样一个画面:机房里堆着十几台刚拆箱的机器,没有光驱,U盘只有一个,一台一台插上去装,装完一台拔下来插下一台,一整… · 2026/9/26 7:26:04

Thread Dump 线下实战:从 jstack 参数到死锁/CPU/线程池故障定位
Thread Dump 线下实战:从 jstack 参数到死锁/CPU/线程池故障定位

简介:一款基于Web的Java线程转储分析工具,面向Java开发者与运维人员,用于在应用响应迟缓或无响应时快速诊断死锁、线程阻塞等并发问题。压缩包约1.49MB,内含81个文件,主要包含Angular前端源码(25个TypeScri… · 2026/9/26 7:26:04

LangChain实战指南:从API调用到RAG与Agent开发
LangChain实战指南:从API调用到RAG与Agent开发

1. 为什么大模型应用开发绕不开LangChain1.1 从“裸调API”到“框架化开发”的必然转变2023年初,我接了一个需求:把公司内部的客服知识库接上大模型,做一个能回答产品问题的问答机器人。当时我的第一反应是——直接调API不就行了?… · 2026/9/26 7:26:04

UNet改进模型大全:37种改进分类与统一训练验证脚本实战
UNet改进模型大全:37种改进分类与统一训练验证脚本实战

简介:这份资源面向图像分割方向的深度学习学习者与研究者,系统整理了37种UNet改进方案,覆盖注意力机制、特征融合与轻量化主干等主流思路,帮助读者在语义分割任务中快速对比不同模块的增益效果。包内共370个文件,以148… · 2026/9/26 7:57:06

SpringBoot SpringCloud SpringFramework版本对应关系与迁移实战指南
SpringBoot SpringCloud SpringFramework版本对应关系与迁移实战指南

如果你手头正在维护一个 Java 后端项目,或者刚接手别人留下一堆“能跑但没人敢动”的历史代码,那你迟早会和“SpringBoot、SpringCloud、SpringFramework 三者版本对应”这件事撞个满怀。它不是面试里背出来的知识点,而是每次新建工程、每次升… · 2026/9/26 7:57:06

2026 AI智能体RAG优化实战:从切块到检索的全链路调优
2026 AI智能体RAG优化实战:从切块到检索的全链路调优

先问一个问题:2026年了,你的AI智能体是不是还在“一本正经地胡说八道”?不管是制度条例学习助手、电力设计规范查询,还是本地ERP产品检索、电影解说生成器,凡是干过这类活儿的应该都有同感——光有LLM不够,… · 2026/9/26 7:57:06

基于Django+Flask的智能物流配送管理系统设计与实践
基于Django+Flask的智能物流配送管理系统设计与实践

做物流调度最头疼的是什么?我的答案不是订单多,而是"车在外边跑,调度室里两眼一抹黑"。去年接手一个城市配送项目时,每天不到三百单,用Excel排线,靠微信群调度,司机到哪了、哪几单顺路… · 2026/9/26 7:57:06

CTF取证利器foremost:文件雕刻与隐藏信息提取实战指南
CTF取证利器foremost:文件雕刻与隐藏信息提取实战指南

在CTF杂项(Misc)和取证类题目里,文件恢复与隐藏信息提取几乎是绕不开的一环。很多新手拿到一个镜像文件或者一张看似普通的图片,第一反应是用binwalk跑一遍,结果发现只能看到几个文件头,真正需要的内容却提… · 2026/9/26 7:57:06

北大青鸟AI大模型课程深度拆解:RAG、Agent与模型微调实战
北大青鸟AI大模型课程深度拆解:RAG、Agent与模型微调实战

每年都会有人来问我北大青鸟的AI大模型课程到底值不值得学,更多人关心的是:这门课讲的东西,和市面上那些“AI提示词技巧课”到底有什么区别。我的回答向来很直接——真正的AI大模型课程,核心从来不是教你怎么和模型聊天&#xff0… · 2026/9/26 7:57:00

数据库课后习题答案别硬背:当测试用例集刷,效率翻倍
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍

简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21

OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40

向下兼容与向上兼容:接口设计中的兼容性策略与工程实践
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践

一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码