纯文本智能体装上精确的眼睛
zouyuanqing/dsh-vision-primitives · 模型适配
给纯文本智能体装上"精确的眼睛":以 Set-of-Mark 编号网格 + 确定性像素坐标数学 为核心,让 Harness 智能体对屏幕/图片做精确到像素的视觉交互推理 —— 全程零外部 MCP 服务器,视觉推理内核 100% 在 DSH Host 运行时内以纯 JS 执行。
★ 2GitHub 星标
0分支
2026-08-24最近更新
JavaScript开发语言
MIT许可证
主要功能
- 智能体即视觉模型插件产出图片路径 + 确定性坐标数学;Harness 多模态智能体(或内置 MiMo 后端)看图决策,插件把"模糊感知"换算成"精确像素"
- inflate(RFC1951 全块类型stored/fixed/dynamic)+ zlib 包装 —— 经 Node zlib 差分对拍 7/7 样本通过
- index.js —— bundle Host 入口(官方 defineTool 门面 + 插件体加载 + settings 注册)
- SOM 编号网格vision_grid 叠加编号网格 → vision_resolve(cell) 得格子中心精确坐标,消除视觉模型坐标误差
- 局部无损放大vision_zoom 最近邻放大(像素级保真),保留到原帧的坐标映射链
使用条件
- 屏幕截取 / 原生 OCR 目前为 Windows 实现(PowerShell Graphics.CopyFromScreen / WinRT OcrEngine)
- 帧文件存储于 sandboxPolicy.workspaceRoot/.vispri
安装命令
dsh plugin --profile web add github:zouyuanqing/dsh-vision-primitives