模型控制实验的 DeepSeek Harness 插件
1105623876/dsh-bench · 技能
用于模型控制实验的 DeepSeek Harness 插件。
★ 1GitHub 星标
0分支
2026-08-16最近更新
JavaScript开发语言
MIT许可证
项目简介
English · 中文 把同一个任务跑在不同模型、不同工具面、不同上下文配置上,得到一张对照实验表:哪个 arm 真的做对了、各自花了多少、慢的那个慢在哪一层。 当任务设计/结果有问题时,它还会直接提醒你的 agent——比如所有 arm 走出相同轨迹的任务,测的是打字速度,不是能力。
插件注册三个工具:benchrun 负责测量,benchhistory 负责和历史运行对比,benchgc 负责回收试验留下的会话日志。每次试验都是一个全新的一次性 spawn 子 agent,它只看得到任务文本、看不到父会话历史——这是各个 arm 可比的前提。 为什么做这个
插件生态里观察单条会话的工具很多——用量面板、上下文构成、轨迹诊断——但没有一个能对比两条。没有对比,就没法回答"换个便宜模型、砍掉一半工具、压低输出预算,结果到底会不会变差",只能凭感觉。
安装命令
dsh plugin --profile web add github:1105623876/dsh-bench