参考了 glm-vision 的「MCP + 代理 + 软规则」三层互补架构
shaoqiuyuavailable/text-llm-vision · 模型适配
让没有视觉的纯文本 LLM(DeepSeek、Qwen、Kimi、GLM 等)在任意主流 AI 编码智能体(Claude Code / Cline / OpenCode / Codex)里真正"看得见"——图片进去,文字描述出来,模型基于描述正常推理。
★ 2GitHub 星标
0分支
2026-08-17最近更新
Python开发语言
NOASSERTION许可证
主要功能
- 全程本地、零 API 费用、数据不出机器。
- 主路径 = MCP Tool Use模型主动调用 mcp_server.py(Python MCP server,stdio,协议层零第三方依赖)暴露的识图工具
- 核心场景纯文本模型需要「看图」
- MCP「自启动」的准确含义MCP server 不自启动、不是 daemon——它是宿主的按需 stdio 子进程。
- 工具直接 import vision_client(Scan→Zoom→Guess 流水线),不依赖代理、独立存活,可挂任意支持 MCP 的宿主。
使用条件
- VS Code 扩展的 Read hook 绕过(upstream bug #37540):扩展的工具执行层绕过 PreToolUse hook,Read 图片 hook 不生效。
- 因此「模型自主看图」走 MCP describe_image(不依赖 hook),而非 hook。
安装命令
dsh plugin --profile web add github:shaoqiuyuavailable/text-llm-vision