
8 月,Harness 成了 AI 圈的 " 热词 "。
先是 7 月末阿里旗下的编程智能体 Qoder 开源辅助工具 Better Harness,随即在开发者社区引发关注。
8 月 13 日,DeepSeek 正式发布并开源 AI Agent 框架 DeepSeek Harness,掀起热潮;此后,国家超算互联网、腾讯 QQ、企微、阿里云、企查查等相继宣布接入 DeepSeek Harness,迅速形成生态扩圈效应。
8 月 20 日,MiniMax 发布 Agent 工作台 MiniMax Design。该公司强调,这是其 H3 多模态模型开源后的首个开源 Harness,聚焦电商、教育及创意短片等场景,着力通过 Agent 来完成任务规划,加强多 Agent 协作,推动模型走向商业化。
越来越多的模型厂商、Agent 产品开始 " 卷 " 起了 Harness,这也被视为争夺开发者生态与商业落地入口的新战场。
Harness 以往主要指编排 AI 工作流、管理提示词模板、系统化评估模型输出的一套执行框架。实际上在今年 3 月至 4 月,这个词就流行了起来。其中最典型代表是 OpenAI 内部通过 " 卷 "Harness 实现 "3-7 人团队、零人工代码起步、5 个月、用 AI 生成 100 万行代码 " 的案例和 Anthropic 连续发文强调 "Harness 决定 Agent 表现 " 的观点。3 月末腾讯集团高级执行副总裁、云与智慧产业事业群 CEO 汤道生有关 "AI 落地的关键是 Harness 工程能力 " 的论断,也让这个词在中文语境中广为传播。
不过,此后有关 Harness 的讨论更多还是集中在业内的工程实现、技术层面。回顾以往也可发现,从大模型、提示词工程到 Agent,这些 AI 专业术语、技术名词真正 " 出圈 ",还需依托传播更广的产品和使用场景。
而今年 8 月,很可能就会成为 Harness 概念走向全面产品化的关键转折点。
从产品定位的角度来说,DeepSeek 官方将其 Harness 定义为模型之外的 " 工程外壳 ",负责让 " 会思考 " 的模型 " 动手干活 ",算是面向开发者的基础设施级产品。同时根据其 "Model+Harness=Agent" 的公式,也可以说 DeepSeek 的 Agent 产品从此起步。而从迭代节奏来说,DeepSeek Harness 开源一周就迭代了两个版本,提供多种使用方式和不同运行模式,也属典型的产品化开发特征。
值得一提的是,DeepSeek 去年 4 月才首次公开发布产品经理类岗位招聘需求,今年 V4 大模型发布前业内频传其会大刀阔斧地在产品化、Coding Agent 等方向进行改变,但并未应验;今年 5 月,DeepSeek 内部立项组建 Harness 专项团队,招聘 Agent Harness 产品经理、Agent Harness 研发工程师等核心岗位人员,此后媒体披露,梁文锋校友、长期在量化机构从事开发工作的崔添翼主导公司 Harness 团队,目标是做出对标 Claude Code 的产品。6 月起 DeepSeek" 大扩军 ",曾一次性开放了 33 个岗位,其中产品类岗位明显增多且愈发细化。可以说,到 DeepSeek Harness 面世,DeepSeek 的产品化尝试已经拿出了阶段性成果。
而从 DeepSeek 此前 " 参与桌面端 Agent 产品全流程开发 " 以及办公、生活、法律、医学等通用场景、专业领域的数据产品经理等招聘岗位需求也可看出,以 Harness 为底座,DeepSeek 此后应该还会继续推出类似 Claude Code 的桌面应用和适用更广泛场景的产品。
产品化、生态扩圈的背后,则是 AI 落地的急迫需求。目前,Harness 被普遍认为能通过沉淀可复用记忆,系统化、标准化地复制 AI 能力,加速 AI 的规模化落地。
北大青鸟人工智能研究院肖睿团队在一份报告中指出,没有 Harness,再强的模型也只是 " 聪明但不可预测 " 的黑箱;有了 Harness,模型才能在约束边界内稳定输出。而这正是 AI 能力规模化地转化成生产力的关键。
以目前 Harness 应用最广泛的 Coding 领域为例,智谱、DeepSeek 的编程工具和 Qoder、Trae 等编程产品的 Harness 模块都着力提供 " 可审计、可复现、可追踪、可回滚、可管理 " 的完整任务执行链,让 AI Coding 能自主 " 跑起来 " 并自我记录、分析、迭代,真正落地于规模化的企业级生产流程,并降低长期运行成本。
不过,Harness 本身的落地也并不容易。
从开发者社区反馈来看,各类 Harness 还是常常遭到运行不稳定、功能逻辑不连贯、" 毛边随处可见 "、缺少 " 人性化 " 细节、配置繁琐易错等 " 吐槽 "。一位开发者评价目前国内的 Harness 产品更像 " 项目制工具 ",仍需要复杂调试、适配,无法标准化复用。而对于如何评估 Harness 的效果目前也缺少共识,甚至成为开发者社区的争议话题。此前一个名为 J-Space Cognition Suite 的项目声称,仅通过一套 Harness 就能让 DeepSeek V4-Pro 的性能大幅提升,甚至超越性能最顶尖的 Fable 5。但随后就有开发者质疑其数据造假、无法复现、Token 消耗翻倍。
总的来说,在国内厂商掀起的这波热潮中,追求 AI 能力可复制、稳定输出的 Harness,本身尚处在 " 边跑边迭代 " 的阶段,只有真正沉淀出一套可复用的标准,并通过真实业务数据持续迭代,才能成为 AI 落地的答案。(本文首发于钛媒体 APP,文|飞向 TAI 空,作者|胡珈萌,编辑|杨林)