DeepSeek Harness的另外一种价值

DeepSeek Harness最近发布,又引来一通热议。
很多人把DPH当成了一个个人使用的agent,可能误解了它的定位和作用。
对于有经验的开发者而言,利用DPH框架更容易构建一个专业agent系统。
然而对于小白用户而言,想要驾驭好它非常不容易。

DPH的本质,是一个面向 Agent 工程的“实验基础设施”,而不是一个面向普通用户的 Agent 产品。
它真正擅长的事情,不是替用户完成一个具体任务,而是帮助开发者系统性地回答几个工程问题:
- 这个模型到底行不行?
- 这套 Prompt 有没有变好?
- 换一个工具以后成功率有没有提升?
- Agent 在什么场景下失败?
- 失败是模型问题、提示词问题、工具问题,还是上下文和运行时问题?
这套框架天然是deepseek内部用来做模型评估的agent框架。
DPH天然适合做 Eval Agent。你可以把一批评估eval cases 放进去,用不同模型、不同 system prompt、不同工具集、不同参数反复跑,再采集完整 trajectory,包括模型输入输出、tool call、tool result、token、latency、错误、最终结果等。
这样它实际上运行流程的是:
评估集Eval Set → Agent Runtime → 轨迹数据Trace/Data Collection → 评估计算Judge → 指标分析Metrics → 比较Compare
这里评估的不只是“模型”。
以往benchmark 往往在问GPT-5.6 和 DeepSeek 哪个模型更好?
DPH 更适合处理这样的问题:
对我的 Sales Agent,在这 300 个真实任务上,Model A + Prompt V7 + Search Tool V3,和 Model B + Prompt V9 + Search Tool V4,哪一套 Agent configuration 更好?
这个差异很关键。
Agent 最终表现近似于:
Agent Quality = Model × Prompt × Context × Tools × Runtime × Policy
模型的训练团队可以用它来去收集训练数据,分析失败,做模型能力评估等工作。
Harness 的价值就在于把这些变量变成可以组合、运行、记录、评估和比较的实验对象。
这个定位跟DPH底层的技术框架有关系。它采用Cordis 开源框架作为基础。
Cordis 更偏向解决“如何动态拼装 Agent Runtime”,Harness 则更像解决“如何运行这些组合并产生实验数据”。
两者组合起来,就很容易形成一个 Agent 评估实验平台:
Eval Case
↓
动态装配Model + Prompt + Tools + Services + Policy
↓
运行 Agent
↓
采集完整 Trace
↓
Judge / Grader
↓
Metrics
↓
实验对比
↓
新的 Prompt / Tool / Agent Version
这也是为什么它对普通小白用户未必有意义。
普通用户的目标通常是:“帮我订酒店”“帮我写报告”“帮我分析客户”。他们希望看到的是 Task → Result,最好中间复杂性全部隐藏。
而 Harness 用户关注的是另一套东西:
“为什么失败?”
“这一版是不是比上一版更好?”
“Claude 换 DeepSeek 后退化在哪里?”
“这个 MCP 工具到底贡献了多少?”
“Prompt 改这一句话,成功率变化多少?”*
“这个失败 case 能不能加入 regression set?”
普通用户消费的是 Agent 的能力,而 Agent 开发者消费的是 Agent 的可观测性、可实验性和可评估性。
所以,我会把 DeepSeek Harness 定义成:DPH不只是 Agent Builder,而是 Agent Experiment Harness。
它最有价值的用户是已经在持续迭代 Agent,并开始面临 eval、regression、trace、dataset、model comparison、prompt optimization、tool evaluation 这些问题的开发者。
此外,DPH,也是数据生产线
再往前一步,它真正有潜力的地方其实不是 Eval UI,而是成为 Agent 的“数据生产线”。
因为一旦 Harness 能持续采集高质量 trajectory。
这些数据后面不仅可以做 eval,还可以反过来做 failure mining、hard case mining、prompt optimization、tool optimization,甚至为模型后训练准备 SFT / preference / RL 数据。
因此,我个人觉得它最最有价值的部分,并且容易被人忽视的部分是:DeepSeek Harness 是给 Agent 开发者用的实验台和数据采集基础设施。用于搭建 Eval Agent,系统评估 Model、Prompt、Tool 和 Runtime,并把 Agent 的真实运行轨迹沉淀成可以持续迭代的数据资产。
这比“一个 Agent 框架”更接近它真正的价值。

从Agent鲁棒性角度而言,DPH也好,Cordis也罢,只是解决了一部分,主要是从副作用管理、上下文管理的角度出发,有些不错的约束和基础。然而这些「harness」和框架并没有解决鲁棒性的根本问题。Agent鲁棒性是一个更复杂的系统问题,不只于此。