近期,AI 编程助手 Claude Code 在国内开发者社区的热度持续攀升。然而,许多开发者在将其接入国产大模型(如 DeepSeek-V3、通义千问、智谱 GLM 等)时,遇到了一个尴尬瓶颈:代码中明明包含截图、UI 设计稿或流程图等视觉资料,模型却因“纯文本”特性而无法读取,直接导致代码“瞎写”或报错。
难道纯文本模型就注定与“看图”无缘?近日,一个开源 MCP(Model Context Protocol,模型上下文协议)组件在 GitHub 与知乎上引发热议——它能让仅支持文本输入的国产模型,通过“图像转文字辅助描述”的方式实现“曲线识图”,从而在 Claude Code 中打通视觉任务的最后一公里。
原罪:Claude Code 的“API 基座”与国产模型的文本限制
Claude Code 与 Claude 官方订阅版不同,它主要面向 API 调用。由于国产模型在中文理解与代码生成上表现出色且价格亲民,大量开发者通过配置第三方网关(如 One API、New API 等),将 Claude Code 的后端替换为国产模型。
但问题随之而来:Claude Code 的系统中,Agent 在碰到图片(如 img::路径 或 Markdown 图片)时,会直接以 Base64 编码的形式将像素数据发送给大模型。Claude 官方模型天然支持多模态识别,而 DeepSeek-V3、通义千问 Max 等绝大多数国产 API 仅支持纯文本输入。模型收到一堆看不懂的乱码字符串后,往往只能回复“我无法解析该图像”或强行瞎猜。
破局:MCP 充当“视觉翻译官”
MCP(Model Context Protocol)是 Anthropic 推出的标准化协议,它允许外部工具无缝接入 Claude Code 的能力。开发者的巧妙思路在此显现:既然模型不能直接“看”,那就让一个第三方视觉模型帮它“看”,然后把结果转成可读文字。
该 MCP 服务的核心逻辑分为三步:
- 拦截并提取:当 Claude Code 检测到用户消息或文件路径中包含图片时,MCP 工具自动截取图片地址与附带的 Prompt 上下文。
- 调用视觉模型解析:MCP 后端调用一个轻量级的多模态 VLM(视觉语言模型,如 Qwen2-VL,或 GPT-4o 等 API),对图片内容进行详细描述、OCR 文字抽取、UI 结构分析。该描述结果被组织成结构化的文本段落。
- 文本回传,模型续写:将“图像描述文本”作为工具返回结果,交还给 Claude Code 中的纯文本国产模型。此时,模型得到了清晰的上下文(如“图片是一个登录页,有输入手机号和验证码的组件”),便能准确生成对应的前端代码或修改逻辑。
落地:真实开发场景中的效果惊人
据测试者报告,接入该 MCP 后,在 Claude Code 中使用通义千问 Qwen-Max 模型,同样能够实现“传一张设计稿,让它生成 Tailwind 代码”的体验。虽然在极端复杂的 UI 还原度上不如原生 Claude 多模态,但对于绝大多数常见的“看图写代码、根据报错截图定位问题、读取流程图需求”场景,准确率已能达到 90% 以上。
更有开发者指出,这套方案不仅适用于 Claude Code,还能横向迁移至任何支持 MCP 的智能体应用(如 Cline、Continue 等)。从某种意义上说,它给所有被“困在文本孤岛”中的大语言模型,打开了一扇无缝利用视觉的翅膀。
未来:国产 AI 工具的“组合拳”时代
该 MCP 的出现,反映了一个更积极的趋势:国内开发者生态正在从“等待官方支持”转变为“主动打造工具链路”。当国产模型在视觉原生活力上尚有不及,我们完全可以通过生态层的外挂能力补齐短板。
无论是将代码截图直接拖进 IDE,让你现在的纯文本模型看懂页面布局,还是通过 OCR 提取监控数据图表——这个小工具,正在让“低成本国产模型 + 视觉外挂”的组合,成为继官方工具之外,最灵巧的编程双翼。如果你想尝试,在 Claude Code 中只需执行 /mcp add 并填入该视觉解析服务地址即可生效。
你还在为模型不能识图而头疼吗?不妨试试这个“曲线救国”的新思路。