DeepSeek 做 Harness,⼀家基模公司拒绝变成水电煤

HelloKitty 2026-08-14 14:10

扫一扫 在手机阅读、分享本文

492

本文由 声浪很大 撰写/授权提供,转载请注明原出处。

以下文章来源于:声浪很大

刚刚,8 月 13 日 20:57 ,DeepSeek Harness 正式上线。

在官方公告中,DeepSeek Harness 采用完全开放的插件式架构,表达了他们想要围绕此建立生态的决心。

此次上线,距离 DeepSeek Harness 团队负责人崔添翼在 X 上发起内测招募仅过去 12 天,而不到三个月前,DeepSeek 才挂出 Agent Harness 产品经理和研发工程师两个岗位。

图片

图片来源:DeepSeek Harness 团队公众号

我们在上一篇文章讨论了 a16z 前合伙人 Benedict Evans 的一个判断:大模型最终更可能演化成一种低毛利的基础设施(low-margin commodity infrastructure),真正捕获大部分商业价值的,未必是模型本身,而是建立在其上的生态。

这个判断我们觉得是理解 DeepSeek 推出 DeepSeek Harness 的一个关键。

8 月 12 日,腾讯发布的 2026 年第二季度财报里,马化腾把 WorkBuddy 和 CodeBuddy 列为应用层的代表,称其实现了突破性的用户增长。而财报正文对 WorkBuddy 何以领先给出的解释有三点:强大的 Harness 工程能力、丰富的模型选择、行业领先的技能库。

而 WorkBuddy 并不是孤例。

2026 年以来,阿里 QoderWork、月之暗面 Kimi Work、字节 TRAE Work、豆包任务模式密集上线,据易观的数据,2026 年 6 月,国内 17 款主流桌面端 AI 原生办公智能体的合计访问量已突破 6000 万次。

这些产品背后的模型并不相同,有的接入多家模型,有的依托自家模型体系,但它们正在争夺的是同一个东西:用户的工作入口,以及对工作流的控制权。

在编程 Agent 这一端也是如此。社区和独立开发者围绕 DeepSeek 模型搭建的第三方 Harness 已经遍地开花 —— Pi 只用四个基础工具和不到 1000 token 的 system prompt 就拿到了 6.2 万 GitHub stars,CodeWhale 专门为 V4 优化拿到了 2.2 万 stars,除此之外,还有 OpenCode、Cline 等通用框架。

如果你是 DeepSeek,你看到的图景是这样的:你做出了全世界性价比最高的前沿模型之一,开发者很喜欢你,但模型之上的 Harness 和 Agent 产品——从 Claude Code 到 WorkBuddy、Cursor 到 Kimi Work——却都在把你变成一个只是被调用的底层工具。你的 API 越便宜,Agent 层越容易起来,这使你变得越像水电煤。这是一个基模公司最不想看到的事情。

所以 2026 年 5 月 20 日,DeepSeek 资深研究员陈德里(Deli Chen)在 X 上发布了两个岗位:Agent Harness 产品经理和 Agent Harness 研发工程师,工作地点北京海淀。岗位描述里写着「Model + Harness = Agent」,以及一连串的竞品名单:Claude Code、Codex、Cursor、GitHub Copilot、Manus、OpenClaw。

今天,DeepSeek Harness 就正式上线。

对于一家基模公司来说,这可能不是一次普通的产品扩张,而是一次主动向上游夺回价值的尝试:当模型越便宜,Agent 层越繁荣,一个基模公司还能靠什么留住用户、控制工作流,并从模型之上正在发生的价值创造中分一杯羹?

Agent 时代,「便宜」开始变成另一种风险

DeepSeek 的性价比,一直是它最重要的竞争力之一。

按照 2026 年 6 月公布的价目表,V4-Flash 的 API 价格是每百万输入 token $0.14、输出 $0.28,输入价格大约只有 Claude Sonnet 4.6 的 1/21、Claude Opus 4.8 的 1/36。

但当模型从 Chatbot 进入 Agent,低价带来的影响会被放大。Chatbot 一次对话可能只需要调用一次模型,而一个 Agent 要完成修复 bug、开发 feature 或者跑一次代码重构,需要不断读取文件、规划步骤、调用工具、执行命令、检查结果,再根据反馈决定下一步怎么做。一个任务调用几十次甚至上百次模型,并不罕见。

同一个 FEATURE 级任务的成本/单位:美元

$2.28Claude Sonnet 4.6

$3.80Claude Opus 4.8

$0.21DeepSeek V4-Pro,不到 Sonnet 的十分之一

测算口径:100 次调用、累计输入 200 万 token。数据来源:Morph,按 2026 年 6 月价目表计算。

模型越便宜,Agent 就越有可能从一个偶尔使用的工具,变成可以持续运行、批量部署的生产力基础设施。

但这也是低价策略真正值得警惕的地方。WorkBuddy、CodeWhale、Kimi Work 这样的产品越繁荣,越可能把 DeepSeek 的模型变成背后一个可替换的组件。用户每天打开的是 WorkBuddy、Cursor 或 Kimi Work,记住的是 Agent 完成了什么工作,不是这一次任务调用了哪个模型。

Benedict Evans 曾经用电信行业做过一个类比:过去二十年,全球蜂窝数据流量增长了数千倍,但运营商的收入几乎没有同步增长,增长出来的流量最终被 YouTube、Netflix、Instagram 吸收,没有被提供网络连接的「管道」所拿走。

如果大模型也走向「管道化」,DeepSeek 今天引以为傲的低价,就可能同时成为它最危险的地方。因此,做 Harness 不是简单地多做一个 Agent 产品,而是在模型越来越像水电煤之前,试图让自己占据更上一层的生态位。

Harness 的价值

「Harness」指的是围绕模型构建 Agent 的工程基础设施层,包括上下文管理、工具调用、任务规划、文件编辑和终端执行、评估与反馈五个核心模块。

「Harness」的价值有多大,可以看看这组数据:同一个 Claude 模型家族,在 Scale 用统一标准化脚手架跑 SWE-bench Pro 时 Opus 4.6 得分 51.90%,而在 Anthropic 自家 harness 下 Opus 4.8 是 69.2%。

将近 20 分的差距里,有相当一部分来自 harness 而不是模型本身。

DeepSeek 的 V4-Flash-0731 则是另一个证明。这个版本和 4 月预览版使用完全相同的模型架构——284B 总参数、13B 激活参数、1M token 上下文窗口——唯一的变化是重新做了 post-training。

同一架构,重做 POST-TRAINING 之后

61.8 → 82.7

Terminal-Bench 2.1

7.3 → 54.4

DeepSWE

38.7 → 76.7

Cybergym

一个主打高性价比的模型在所有九项基准测试中的表现都超过了自家旗舰 V4-Pro-Preview。DeepSeek 特别注明,公开基准中的 Code Agent 任务使用的是「DeepSeek Harness minimal mode」,九项里的 DSBench-FullStack 和 DSBench-Hard 则是内部测试集。不改变架构和参数量,仅靠 post-training 加上 Harness 配合,就实现了通常需要一代新模型才能达到的提升。

问题在于,今天大部分 Harness 都不在模型公司手里。Pi、CodeWhale、OpenCode、Cline 这些第三方项目定义了开发者如何使用模型——上下文怎么管理、工具怎么调用、失败了怎么重试、哪些数据被记录——而模型公司对这些没有话语权。

而已经把 Harness 握在自己手里的那些玩家,正在两面夹击 DeepSeek。

一面/海外模型公司向上

Anthropic 2025 年推出 Claude Code,到 2026 年在多份开发者调查中拿下第一,另有调查显示 75% 的初创公司把它作为主要编程工具。OpenAI 的 Codex 在 6 月 2 日的官方口径是超过 500 万周活跃用户,其中约两成已经不是开发者,到 7 月下旬 Codex 与 ChatGPT Work 的合计活跃用户被报为 1000 万。

另一面/国内应用层向下

腾讯 WorkBuddy 底层混合调用了多个模型,而用户正在向 WorkBuddy 迁移自己的工作流,Kimi Work、字节 TRAE Work 也都在尝试占用户和 AI 的交互入口位置,以及由此产生的工作流数据。

DeepSeek 的两个岗位招聘明确指向了一个桌面端 Agent 产品,职位描述写的是参与 DeepSeek 桌面端 Agent 产品的全过程。

因此,与其说是进攻,不如说这是一次 DeepSeek 不得不做的防守:如果不自己控制模型到 Agent 的完整链路,它最终就会变成 Evans 预言中的那种「低毛利基础设施」。

但防守只是起点:Harness 可能是下一代模型的训练入口

但我们认为,防守只是一个起点。

对 DeepSeek 而言,自己做 Harness 还有一层更深的意义:一旦掌握了 Harness,DeepSeek 就能看到 Agent 完成任务的完整执行轨迹(trajectory)——怎么规划、调用了什么工具、哪一步失败了、怎么修复的、最终结果是什么。

这些执行轨迹数据,正是训练下一代 Agent 模型最稀缺的资源。

关于这一点,学术界已经有了系统性研究。

2026 年 4 月公开的 AgenticQwen 论文提出了「agentic data flywheel」(Agent 数据飞轮):先用单一执行路径的合成任务打底,每一轮强化学习之后,让更大的模型分析已有轨迹、注入条件分支,把线性任务扩展成行为树,从而持续提高任务复杂度。

值得注意的是,这套飞轮跑在 LLM 模拟的环境里,用的是合成任务而非真实用户轨迹——这恰恰反衬出真实执行数据的稀缺。

Skywork 的 SWE 研究则展示了执行轨迹在编程任务上的直接价值:用高性能模型在 OpenHands 框架上生成轨迹,通过完整测试套件验证,再用通过验证的轨迹训练 32B 模型。

产业侧也有了明确的数字。2026 年 2 月,Cursor 在发布 Composer 1.5 时披露,其 post-training 阶段投入的强化学习算力超过了基座模型预训练所用的算力。这是目前少见的、由厂商自己给出明确口径的一次披露,尽管 Composer 系列的基座是月之暗面开源的 Kimi K2.5,它的算力结构本来就偏向 post-training 一侧。

如果这个判断成立,那么 DeepSeek 做 Harness 深层逻辑就不只是防守,而是构建一个闭环:

01Model 生成 Agent 的能力

02Harness 决定 Agent 如何工作

03Agent 在真实任务中产生 trajectory 数据

04trajectory 数据反过来通过 RL 训练出更强的 Model

Model → Harness → Agent → Trajectory → Model

掌握 Harness,就掌握了这个闭环的入口。

微信图片_20260701173519_3_668.jpg

微信图片_20230104175528.jpg

扫一扫 在手机阅读、分享本文

扫码关注公众号

获取更多技术资讯

精选活动 更多 >

{{ val.activity_name }}

{{ val.province ? (val.province + ' ' + val.city) : val.location }}
客服微信
享受1V1专属服务
免费领取技术福利
发送名片申请入群
与CTO聊合作
(备注姓名、公司及职位)
热门文章