vision · 智能体视觉工具箱
reimu-create/dsh-vision · 模型适配
DSH 插件:纯文本模型(例如 DeepSeek-V4)通过视觉模型自动查看图像。
★ 3GitHub 星标
0分支
2026-08-16最近更新
JavaScript开发语言
MIT许可证
主要功能
- 包装 llm/stream 的 streamWithRegistration 方法:请求含 image 块且目标模型未声明 image 输入时触发(适配器层之前的准入门禁由 resolveModelInfo 包装放行,二者联动)
- 自动桥图片出现在纯文本模型的请求中时自动转换,无需模型或用户做任何事
- 用视觉模型把图片转为文字描述(描述带"识图结果"身份标记,主模型明确知道内容来自识图模型)
- 把描述作为一条 user/message surface-replace 事件 append 进会话日志(与 compaction 压缩历史同款机制)——只对模型可见,人类转录保留原图
- 本次请求用同一份描述改写后放行,首轮即成功;模型调用 read_image 等工具返回的嵌套图片同样被递归识别改写
使用条件
- 依赖 dsh 预览版 API(llm/stream waterfall、surface replace、foldSurface),rc 升级若改签名需同步更新
- 图片位于历史中部首次出现时,该轮从图片处起前缀缓存失效一次,之后恢复(前缀缓存固有特性)
安装命令
dsh plugin --profile web add github:reimu-create/dsh-vision