智能体视觉工具箱
wangyang10/image-vision · 技能
image-vision 让没有视觉能力的模型(如 DeepSeek 等纯文本模型)也能"看图":自动调用 OpenAI 兼容的识图模型 API(OpenRouter、SiliconFlow、智谱、Kimi、通义千问、 本地 Ollama 等),完成图片描述、问答、OCR 等任务。
★ 8GitHub 星标
0分支
2026-08-14最近更新
JavaScript开发语言
MIT许可证
主要功能
- 当前模型不具备视觉能力时,自动调用识图 API 读取图片
- 一个仓库,多个 Agent 宿主同一套技能逻辑分别以标准 skill 和宿主插件的形式 提供给 Codex、Claude Code、DeepSeek Harness(DSH)等使用。
- skills/image-vision/scripts/vision_query.py(Python)与 dsh-image-vision/lib/(JS 移植)是同一套逻辑的两份实现,改动预处理/API 行为时需同步两边。
- 支持本地图片、http(s) URL、data URL
- 支持多图对比
安装命令
dsh plugin --profile web add github:wangyang10/image-vision