首页/新闻资讯/正文详情

实测DeepSeek Harness:AI到底能替测试开发做多少工作?

发布时间:2026/9/26 17:56:28 来源:云帆数科 栏目:资讯中心
实测DeepSeek Harness:AI到底能替测试开发做多少工作?
1. 为什么我要把 dsh 拉进 Node.js 测试开发流程DeepSeek Harness下面统一叫 dsh是一个把大模型能力封装成可交互工作台的命令行工具能读本地代码和文档、生成用例、写测试脚本、跑命令、分析失败日志。它适合谁适合已经在写 Node.js 服务、手里有一堆接口要测、但不想把每个用例都手敲一遍的测试开发同学。我这次没有泛泛地聊AI 能不能替代测试而是把日常测试开发拆成需求解析、用例设计、脚本编写、执行调度、缺陷定位五个环节逐项交给 dsh 做一遍再逐项打分最后算一笔综合替代度的账。先说结论方向dsh 在重复性强的环节接得住在需要判断的环节只能当参谋。下面所有操作都基于 Node.js 环境模型通道我统一走 TaoToken 的 API这样 Key 管理和成本看得清也方便你在同一套配置里切换模型。整篇给的是可复制的配置骨架、可执行的验证动作以及一张结果对照表你照着跑一遍就能得到自己的分数。2. TaoToken 前置统一 Key 与 API 通道dsh 原生接 DeepSeek 模型也支持通过 LLM 适配器接其他模型。不管接哪个你都需要一个 API Key 和一个 base URL。我这次用 TaoToken 作为统一通道原因是它把 Key 和调用入口收敛到一处测试开发场景里经常要在多个模型间对比效果统一通道省得每个模型配一遍。你需要先拿到 Key。打开官网注册后进入控制台在 API Keys 页面创建一个新 Key复制出来形如sk-xxxx的字符串。这个 Key 只显示一次建议直接写进环境变量而不是硬编码进代码。官网入口https://taotoken.net/?utm_sourcetaotoken_aicg_blog_endAPI Keys 管理页https://taotoken.net/api-keys?utm_sourcetaotoken_aicg_blog_endutm_contentapi_keysutm_campaignrewrite接入文档https://taotoken.net/doc?utm_sourcetaotoken_aicg_blog_endutm_contentdocutm_campaignrewriteAPI 基址不加 UTMhttps://taotoken.net/api注意Key 属于凭证不要提交到 Git 仓库也不要贴进公开的 issue 或聊天记录。用环境变量或本地.env并加入.gitignore是更稳的做法。3. 可复制配置dsh 安装与 Node.js 项目接入3.1 安装 dsh求快的一行流需要本机有 Node.js建议 18 以上npx deepseek-ai/dsh web # 默认 Web UIhttp://127.0.0.1:3080想跟着源码跑、方便看它到底怎么调模型的git clone https://github.com/deepseek-ai/deepseek-harness.git cd deepseek-harness pnpm install pnpm run build pnpm dsh webdsh 当前是 developer preview官方明确说会有破坏性变更所以下面的配置和分数只对当前版本有效。运行模式有标准、PTC、极简、创造四种本次打分全程用标准模式口径统一。3.2 配置模型通道把 TaoToken 的 Key 和 base URL 写进环境变量。Linux/macOSexport DEEPSEEK_API_KEYsk-xxxx export DEEPSEEK_BASE_URLhttps://taotoken.net/apiWindows PowerShell$env:DEEPSEEK_API_KEYsk-xxxx $env:DEEPSEEK_BASE_URLhttps://taotoken.net/api如果你用.env文件管理在项目根目录建一个# .env DEEPSEEK_API_KEYsk-xxxx DEEPSEEK_BASE_URLhttps://taotoken.net/api然后在.gitignore里加一行.env。dsh 启动时会读取这些变量模型请求就会走 TaoToken 通道。3.3 准备一个背景项目为了口径统一五个环节用同一个背景项目一个库存管理 API包含录入、查询、出库三个接口文档放./docs代码放./app。目录结构大概这样inventory-api/ ├── docs/ │ ├── create.md │ ├── query.md │ └── outbound.md ├── app/ │ ├── routes/ │ └── services/ └── tests/每个环节单独下发一次任务避免长链路互相干扰。用例设计环节的提示词样例阅读 ./docs 下的接口文档和 ./app 下的代码提取测试需求 输出用例设计要点包含等价类划分、边界值和异常场景逐条列出 每条写清楚前置条件、操作步骤和预期结果。4. 验证请求五个环节逐项跑一遍4.1 需求解析下发任务后dsh 能从文档和代码里提取入参、出参、错误码。文档写得清楚它提取得就齐但库存为零不允许出库这类没写进文档、只存在于业务方脑子里的规则它不会凭空知道。解析的本质是翻译翻译离不开原文——这一项的分数其实有一半是给文档和代码写得够不够清楚的。验证动作把同一任务换到一份只有口头转述、没有文档的项目上重测解析质量明显下滑。这说明输入质量决定输出质量。4.2 用例设计这是最省人的一环。它给的是具体可执行的用例描述不是测试正常流程这种正确的废话边界值会主动凑成对刚好等于阈值、刚过阈值各一条异常场景也知道往负数、超长字符串、缺字段上想。等价类、边界、异常覆盖较全是全链路里最出彩的一环。4.3 脚本编写形态不错会用 fixture、会参数化断言具体到状态码。但它偶尔会编出不存在的接口或者假设错返回结构每一条都要人看。我们的做法是生成完先跑一遍红的先人工分类——是代码错还是用例错——再决定改哪边。一个典型的生成片段pytest 形态Node.js 项目里可对应改成 Jest/Vitest// 生成后需人工评审的示例 describe(outbound, () { it(库存刚好等于出库量时应成功, async () { const res await request(app).post(/outbound).send({ sku: A1, qty: 10 }); expect(res.status).toBe(200); }); it(库存为零时应拒绝出库, async () { const res await request(app).post(/outbound).send({ sku: A2, qty: 1 }); expect(res.status).toBe(409); }); });4.4 执行调度短板很明显响应速度偏慢任务链一长就容易不稳实测中我们遇到过循环打转反复读同一份日志不往前走另外 API 成本随任务长度放大长任务跑下来账单感受明显。建议拆段下发每段有明确产出物人守在旁边。4.5 缺陷定位算是好参谋给它失败日志它能圈出可疑行、给出几种可能原因的排序。但从可疑到确认中间隔着人工复现和验证这一步它替不了。4.6 结果对照表环节评级一句话结论需求解析可用偏上能从文档和代码里提取输入输出与规则隐性规则会漏需要人补用例设计强等价类、边界、异常覆盖较全是全链路里最出彩的一环脚本编写可用偏上形态良好、断言明确偶有臆造接口必须评审执行调度弱能执行命令但响应偏慢、长任务稳定性不足偶发循环打转缺陷定位可用能从日志里圈出可疑点并给假设确认还得靠人5. 本篇常见错排查5.1 启动报错找不到模型或 401先确认DEEPSEEK_API_KEY和DEEPSEEK_BASE_URL在当前终端会话里生效。PowerShell 里$env:只在当前窗口有效新开窗口要重新设。用echo $DEEPSEEK_API_KEYLinux/macOS或echo $env:DEEPSEEK_API_KEYPowerShell检查是否为空。401 通常是 Key 复制时带了空格或换行。5.2 请求走不通或超时确认 base URL 写的是https://taotoken.net/api不要多加路径后缀。如果公司网络有出口限制先确认能正常访问该域名。dsh 响应偏慢是常态单个环节等几分钟很正常不要误判为卡死。5.3 生成脚本臆造接口这是脚本编写环节的高频问题。对策是生成完先跑一遍红的先人工分类是代码错还是用例错。把真实的路由和返回结构喂给 dsh能明显降低臆造率。5.4 长任务循环打转实测中遇到过反复读同一份日志不往前走。对策是拆段下发每段有明确产出物人守在旁边。这既是为稳定也是为省钱——一次打转就多烧一截 token。5.5 成本随任务长度放大环节越多、打转越多API 账单越明显。把任务拆短、一次说清是控制成本最直接的手段。在 TaoToken 控制台可以看用量方便你对照每个环节的实际消耗。6. 算一笔综合替代度的账最后做个加权粗算权重按我们团队的日常工时占比估仅供参考环节权重可替代度需求解析15%约五成用例设计25%约七成脚本编写25%约六成执行调度20%约三成缺陷定位15%约四成加权下来综合替代度大约一半到三分之二。注意两个口径其一这个数指省下的是重复劳动的时间还没扣评审耗时把评审算进去净收益还要打折其二替代度高的恰好是重复性强的环节替代度低的恰好是需要判断的环节——这不是巧合。所以结论很干脆AI 替代的是重复劳动不是判断力。铺用例量、写脚本骨架、跑命令、翻日志这些 dsh 接得住定测试策略、定验收标准、拍板风险依然是人的事。它是强力助手不是无人值守的替代者。如果你想把这条链路跑顺建议先把 Key 和通道固定下来再逐环节验证。模型对话入口可以在这里试https://taotoken.net/chat?utm_sourcetaotoken_aicg_blog_endutm_contentchatutm_campaignrewrite 长期做编码和 Agent 任务的话Coding Plan 更划算https://taotoken.net/coding-plan?utm_sourcetaotoken_aicg_blog_endutm_contentcoding_planutm_campaignrewrite 接入细节看文档https://taotoken.net/doc?utm_sourcetaotoken_aicg_blog_endutm_contentdocutm_campaignrewrite 。

相关推荐

把 ChatGPT(Codex)变成科研执行助手:TaoToken 配置、插件、Skill 和工作流
把 ChatGPT(Codex)变成科研执行助手:TaoToken 配置、插件、Skill 和工作流

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 17:56:28

用Codex搭AI短剧自动化流水线:从分镜提示词到字幕生成的实战指南
用Codex搭AI短剧自动化流水线:从分镜提示词到字幕生成的实战指南

去年年底我开始折腾AI短剧,就是那种三五分钟一集、竖屏播放、靠AI工具生成画面和配音、最后剪成剧情小短片的玩法。最开始我特别乐观,觉得有AI加持,一个人怎么也能顶一个小团队。结果真上手以后才发现,AI只是解决了“从无到有”的… · 2026/9/26 17:56:15

Codex控不了浏览器?模型层到执行层的全链路排查指南
Codex控不了浏览器?模型层到执行层的全链路排查指南

最近好几个同学跑来问同一个问题:Codex 明明能正常聊天、能写代码、能调工具,但只要涉及“控制浏览器”就歇菜——让它打开个网页、点个按钮、截个图,它要么装死,要么报一串看不懂的错。“Codex 控不了浏览器,求排查思… · 2026/9/26 17:56:15

业务层用JUnit,表现层用Postman:接口测试分层实践指南
业务层用JUnit,表现层用Postman:接口测试分层实践指南

我刚接手测试体系建设那会儿,被问得最多的一句话是:这个接口该用 JUnit 测,还是 Postman 测?说实话,这个问题本身没有标准答案,但如果你把问题拆成“业务层该用谁、表现层该用谁”,思路一下子就… · 2026/9/26 18:34:04

AI原生开发实战:Anthropic SDLC手册核心原则与落地指南
AI原生开发实战:Anthropic SDLC手册核心原则与落地指南

1. 这份手册到底在讲什么Anthropic 把内部用了很久的一套 AI 原生软件开发方法公开了,名字叫The AI-Native SDLC Playbook。SDLC 就是软件开发生命周期,从需求到设计、编码、测试、部署、运维这一整条链路。这份手册的核心主张很直接:把 AI 当… · 2026/9/26 18:34:04

600B开源模型性能追平Claude、成本仅八分之一,开发者如何快速接入实战
600B开源模型性能追平Claude、成本仅八分之一,开发者如何快速接入实战

刚看到这条消息的时候,我的第一反应是去翻开源模型排行榜和API价格表。600B参数、成本只有Claude八分之一、全球前三、10月15日全部开源——这里每个关键词都值得拆开细看,它们拼在一起,几乎是给开发者提前发了一张过年的门票。我在开源模型氛… · 2026/9/26 18:34:04

JUnit与Postman的分工:业务层与接口层的测试边界
JUnit与Postman的分工:业务层与接口层的测试边界

写自动化测试的同学应该都有过这种纠结:一个接口已经用 Postman 调通了,还要不要写 JUnit?一个 Service 方法明明能跑通,是不是让 Postman 再验一遍就算完事?我见过不少团队在这个问题上反复摇摆,最后要么是… · 2026/9/26 18:34:04

AI搜索里的“以小博大“:22.5万条引用数据,揭示可见度为何和市场份额脱钩
AI搜索里的“以小博大“:22.5万条引用数据,揭示可见度为何和市场份额脱钩

核心摘要:新加坡研究机构Pranas Platforms在2026年9月21日发布的研究,分析了2026年8月产生Google AI Overviews结果的20839条提问、225094条来源引用后发现:一个市场份额只有个位数的品牌,可以出现在21.1%的相关提问结果里&#x… · 2026/9/26 18:34:04

程序员高质量摸鱼指南:效率休息与碎片学习网站推荐
程序员高质量摸鱼指南:效率休息与碎片学习网站推荐

作为一个程序员,要是没收藏过几个摸鱼网站,都不好意思说自己在工位上坐过十年。我见过太多同行把摸鱼搞成了一种负担:一边怕被项目经理发现,一边又忍不住刷手机,结果活儿没少干,班味倒是越来越重。今天我想… · 2026/9/26 18:33:50

数据库课后习题答案别硬背:当测试用例集刷,效率翻倍
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍

简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21

OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40

向下兼容与向上兼容:接口设计中的兼容性策略与工程实践
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践

一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码