小刘BOT

DSH 插件:如何看懂 Deepseek Harness 的「轨迹」?

DSH 的一大亮点,就是它的「轨迹」系统。

一般大家熟悉的 Agent Harness 在执行任务的过程中,后台往往是一个黑盒。而在 DSH 中,每一次与大模型的交互、收发信息、工具调用等等都在「轨迹」中透明可见。于是用户可以清晰地知道 AI 在执行任务的时候,具体都做了什么

像上面这张截图,每一个环节花了多少时间,消耗了多少 Token,查看了哪些 skill,使用了哪些工具,执行了什么命令等等,全都被清晰地披露了出来。

通过它,理论上你可以复盘优化 AI 执行任务的过程中所有成功和失败的细节,让你用得越来越顺。

但是,像这样的 AI 执行轨迹呈现形式,还是显得过于极客了一些。我相信大多普通用户应该跟我有相同的感受,这些轨迹固然是好的,但阅读起来也是十分吃力的。

与其埋头硬看,还不如让 AI 帮读。

所以我就做了这样一个侧边插件。

接入 AI 来直接翻译这些执行轨迹到底都是什么,让人类用户能直接了当的知道执行任务的 AI 具体做了什么,是怎么做的,中间出了哪些错,有哪些风险的行为,最终得出的结果又是怎样的。

相比于传统的黑盒 Harness 只能在旁边干等,借助这个插件,你可以一边让 AI 执行任务,一边监督它是如何执行的。

如下图,我要求本地部署的 Qwen3.8-27b 去网上帮我调研一下最新的 MacBook Pro 的配置和价格。但是这毕竟是一个还没有充分磨合的本地部署的量化版本小模型,我对它还没有足够的信任。于是我就可以打开侧边的解读,选择使用便宜大碗速度又快的 Gemini 3.7 Flash 来解读它的执行轨迹。

从插件的解读中,可以看到,Agent 先是并行调用了两次搜索,获取到了 M5 和 M5 Pro / Max 系列发布信息和起售价格。

然后又去查看了 IT 之家、Macworld 和苹果官网,补充海内外的定价和规格信息。

之后通过官网的数据对比,发现当前价格跟发售价格不一致。应该是发现了今年 618 后苹果官方那一轮涨价。

之后确认了涨价确实存在,开始结构化提取产品规格和价格……

并且每一步的执行中都会由 Gemini 3.7 Flash 提供一个总体的执行判断,评估当前执行 Agent 的行为是否合理,给出风险等级的评级,以及给出一个下一步动作的参考思路。

太长的案例执行细节我就不放了,总之,最后一通操作,最终成功得到了中美两地官网的 MacBook Pro 配置和价格,并且特别标注了价格变动的情况,还给出了一个简短的选购建议。

还是得感慨,Qwen3.8-27b 真是小钢炮,整轮任务执行下来,结果正确,过程的逻辑也没问题。本地部署的量化版本,做到这个水平真是给力啊。

回到这个插件。

如果你觉得 Agent 在执行过程中有重点的可疑环节,或者说你认为 Gemini 模型并不靠谱,你可以使用不同的模型对轨迹分析两次进行对比

还觉得有问题的话,你还可以再套一层娃,召唤外援判官,直到把问题搞清楚。

其实套在 Codex 里用是我对 DSH 最常用的使用场景了,不仅是召唤 GPT 5.6 来审计模型轨迹,也可以有其他的玩法,这个我们后面有时间再说。

也可以再完成一次长执行之后,把出现的问题汇总展开,自己认真分析都有什么值得调优的问题。

果然 Windows 上的 PowerShell 就是一根可以绊倒一切的绳子。

总之,这个插件的作用就是帮你快速了解模型都干了啥,怎么干的,进而判断它执行的有没有问题,从此不再懵逼。

插件安装起来也非常的简单,你甚至不用手动安装,直接告诉 AI:

请帮我安装这个 DSH 插件:https://github.com/Liu-Bot24/dsh-trace-insight

这就可以了,AI 会帮你装好的。

玩得愉快!