}


一边,是不少人狂夸 DeepSeek 的新模型 V4 Pro 正式版真牛,是 Fable 5 级别的发布、核弹被吓得瘫坐在了奥特曼身上。

另一边是网友们吐槽涨价、模型能力似乎不及预期、甚至被怀疑部署错了模型。。。

DeepSeek V4 Pro 正式版的这一次更新,虽然不是最炸裂的一次,但绝对是评价最割裂的一次。

到底是梁圣,还是梁白开?这一波似乎是薛定谔的梁。。。


但只能说,在过去的一段时间里,大家能体验到的,其实是一个不完整版的 DeepSeek。

细心的网友们肯定都发现了,在从 V4 Flash 正式版开始, DeepSeek 官方的模型跑分表格下面,会有这么一行小字告诉大家:这些成绩是在 DeepSeek Harness ,简称 DSH 里跑出来的。


在这,也给一些差友简单科普一下 Harness 这玩意儿。

这么说吧,大模型本身,只是一个极其聪明的缸中之脑。

如果你想让这颗聪明的大脑去干活,比如帮你写一段代码、查一查资料、调用各种用工具完成个复杂任务,你就必须给它装上机甲和神经系统。

在 AI 行业里,这个给模型接上工具、管理它运行状态的外骨骼机甲,就可以被称为Harness。

同样的一颗大脑,也就是模型,在 Codex、ClaudeCode、Workbuddy 们等等不同的 Harness 下,展示出的能力其实都不一样。

所以说整个AI圈,也都对这个 DeepSeek Harness 充满了兴趣,为啥能让模型跑分提升这么多?


而就在刚刚满血DeepSeek的拼图,终于凑齐了,憋了那么久的 Harness 工具终于发了。

有了它,DeepSeek V4 Pro/Flash 才能发挥出真正的水平。

这个工具的能力有多强呢?

看参与内测的程序员头像合集就知道,这东西强的可怕。


咱们也是在预览版发布的第一时间上手体验了一波,用完后差评君只能说:

它或许不是最适合新手的AI工具,但绝对是上限最高的 AI 工具之一。

因为你可以亲手塑造这个工具里的每一个部分,修改里面每一个用的不爽的地方。

当然这个概念说起来可能有些复杂,不过问题不大,咱们可以从最最最基础的 UI 界面开始说:

光看整个 DSH 的第一眼,你可能会觉的它和网页端的 DeepSeek 没多大区别。

都是左边一个边栏查看记录,右边一个大块的对话框来聊天干活,聊天框的左上可以选择工作的区域,聊天框的右下角可以选择模型和推理的强度。


这些都是咱们的老朋友了,但是仔细一看就会发现,DeepSeek 提供了一个和其他 AI 工具都不一样的功能:

可以在标准模式、极简模式、PTC 模式和创造模式这四种工作状态之间切换干活。

差评君仔细研究了一下,发现这四个模式还挺有意思的,


标准和极简模式这哥俩就不多说了,相信大家看名字就能看出来这是个啥东西。

前者就是大家平时使用 AI 时的模式,咱们简单试了一下,让它做了个 MC 风格的传送门游戏来玩。

结果人也没含糊,三下五除二就给搓出来了,全程只花了 1.56 元。


后者主要用在模型测试上,把一些花里胡哨的功能全部都去掉了,让模型全凭自己的本事说话。

但是这个新出来的 PTC 模式,应该大家都没怎么见过。

差评君也仔细研究了一下,发现这个模式的目的就只有一个。

那就是如何教会 AI 高效的干活。

一个再简单的问题,重复个 100 次、200 次,可能模型的上下文就会被塞爆。

比如说我们准备点个外卖,就需要让 AI 查到附近的餐厅。

如果一下子把几百家的餐厅信息都读到 AI 里面,那模型的上下文很容易就被塞爆。

但是在 PTC 模式的帮助下,我们就可以让 AI 主动写代码、设置筛选条件来解决问题。这样,进入模型上下文的内容就会更加简洁,模型本身的能力也不会有太大的折损,干起活来更利索。


而创造模式就有更有意思了,简单来说,你可以用这个模式来自己给 DeepSeek Harness 来写插件,自己来更新自己的 DSH 客户端。

咱们前面聊到 DSH 它上限高,很大一部分原因就在这里。

过去像 Claude Code、Codex 这类工具,通常都会先有一个比较完整的官方主体。


通过这个主体,配置好了模型最基本的文件读取、代码修改、任务分配等等能力,大家虽然也能在这些软件上继续写插件改代码,但是项目整体的骨架已经定死了。

而 DeepSeek Harness 这里,则是一切都能改,一切功能都是插件,一切都被修改。


举个例子,前面不是说了,这 DeepSeek V4 Pro 有四个工作模式嘛。

咱们现场就让它来再做个出第五个工作模式: “ 生存模式 ” 来看看效果。

只要简单的和它说出咱们的需求,DSH 就和过去一样的拆解问题,然后来自己实现问题。


在经过了几轮调教后,咱们就得到了一个全新的生存模式。


开启了生存模式后,DeepSeek Harness 不但在干活的时候会非常节省 Token,而且还会在界面的左下角,通过血条和法力值的方式,来显示当前项目的剩余 HP ( 上下文长度 ) 还有剩余的 MP ( 还有多少账户余额 )

当血条不够的时候还能自动提醒用户回血 ( 压缩上下文 ),蓝不够的时候也会提醒你要补魔 ( 充值 ) 了。

等到彻底没血没蓝,就说明是生存失败 G 了


当然,差评君这只是小试牛刀玩了一下,实际上,在那堆内测大佬手里,DeepSeek Harness 已经被他们玩出花来了。

就比如有人直接做了一套鲸鱼娘的娘化皮肤。。。

https://github.com/zhu1090093659/dsh-web-ui


还有哥们整活,给自己做了套广告在上面。

https://github.com/Nagi-ovo/dsh-ads


而且大家也不是全在整花活,也有人从底层入手,给 DSH 做了一套全新的图片识别能力。

https://github.com/Anionex/dsh-vision-toolkit


当然,这种一切都是插件,一切都能随意的安装,卸载组合的能力听起来很酷。

但做起来那是一点也不简单。

咱们平时电脑里删个软件都删不干净呢,而 DeepSeek 为了能把这么多插件的加载,卸载给搞明白,还花了不少心思研究。

DeepSeek 和北大特意还搓了篇论文出来,名叫《 时空可组合性的编程范式 》。

研究完我发现,DeepSeek 不只是为了酷,他们是想给 AI 定制个动态的操作系统。


他们把矛头,直至一个现代软件的工程难题:到底怎样,才能让复杂的系统在运行时,可以安全、自由地拼装和拆卸。

在 AI 时代,这件事儿就显得更重要了,无论是 Agent 执行任务还是自进化过程中,一直熄火重启,谁也顶不住啊。

相当于是,在一辆汽车在高速公路上不能熄火的情况下,有啥办法能自由地改装、维修这辆车。 DeepSeek 在论文里,直接先用数学证明了,这件事情是能做到的。

其中一招是时间可组合性,相当于 AI 做的每一个动作,系统都在底层偷偷备好了一副逆操作,也就是后悔药。

如果模型发现自己刚刚调错了一个接口,它可以瞬间启动逆向操作,把修改的状态完美恢复到弄坏前的样子,不需要重启。

还有一招是空间可组合性,插件组件们就像插座和插头,A 如果声明自己需要组件 B 提供的电源。

系统会自动监控,一旦组件 B 就绪,系统就自动激活组件 A;一旦组件 B 准备被拔除,系统会自动先让依赖它的组件 A 优雅地停工,然后再真正撤销组件 B,让整个依赖网络的启停完全自动化。

总之这篇论文挺复杂的,差评君也只是看了个皮毛,感兴趣、神通广大的差友可以去研究研究。


最后,回到现在到底是梁圣、是梁子、还是梁白开话题上。

不能否认,在 DeepSeek V4 Flash 正式版不仅白菜价,还原地变强的背景下。。。

这次的 V4 Pro 确实没给一些人,带来期待中的新模型智商暴涨。

包括特殊环境下的算力稀缺,也让 DeepSeek 没守住之前的白菜价。


但说实话,无论是 R1 的横空出世,还是 V4 Flash 的 “ 只收电费钱 ”,包括这次的 DeepSeeK Harness,DeepSeek 一直在给大家制造惊喜。

或许这个永远充满变数的 DeepSeek、不按常理出牌的梁文锋,才是大家热衷于 “ 滑动变祖器 ” 梗的根本原因。

最后的最后,我也大胆预测一波,因为 DeepSeek Harness 的可玩性实在是太强了,估计市面上马上就会有各种样式,基于 DeepSeek Harness 的变种 Agent 出现。

说不定,曾用极致的开源和性价比,砸开了大模型普惠的大门的 DeepSeek,这次会用 Harness,硬生生把 AI 带进了 Agent 普惠的新时代。

撰文:江江 & 早起

测试:不咕 & 早起

编辑:江江 & 面线

美编:焕妍

图片、资料来源

deepseek harness