DeepSeek Harness 视觉桥
liustack/modlens · 技能
为纯文本编码智能体补充 OCR、布局和语义理解能力,并输出结构化视觉证据。
★ 1,573GitHub 星标
41分支
2026-08-15最近更新
TypeScript开发语言
MIT许可证
项目简介
DeepSeek 和 GLM 的主力对话模型是纯文本的,无法进行图片识别。ModLens 借助外挂视觉引擎,为纯文本模型补上视觉能力。ModLens 支持直接粘贴图片识别,无需先保存成文件再提供路径。 交流
欢迎随时提issue。也欢迎来 X 上聊:@liustack,你用它做了什么、在哪个 harness 上跑、接下来该做什么,新版本也是那边先发。社群正在筹备中。 亮点 🥇 全网第一个支持 DeepSeek Harness(dsh)的外挂视觉识别插件:一条命令 npx -y @deepseek-ai/dsh plugin --profile web add @liustack/modlens@3.16.6,dsh 背后的纯文本 DeepSeek 模型即可通过原生 modlensreadimage 工具读图。更新就是再跑一遍同一条命令。这里点名版本号而不用 @latest 是有意的:pnpm 11 会扣住最近 24 小时内发布的版本,dist-tag 只在剩下的里面解析,用 @latest 装到的会是一天前发布的那个(细节)。
装完即有 modlensreadimage 工具,选「(modlens vision)」模型变体即可直接粘贴识图。引擎配置同样在 /.modlens,详见宿主接入。 用法
安装命令
dsh plugin --profile web add github:liustack/modlens