DeepSeek 本身没有直接处理图片时,一个比较灵活的办法并不是更换主模型,而是给 Agent 增加一个专门负责图片分析的工具。
这次使用的是 Reasonix + MCP/Skill + 智谱 GLM-4V-Flash。平时依然让 DeepSeek 负责对话和任务处理,只有遇到图片时,再调用视觉模型完成识别。
简单理解就是:
图片 → Reasonix → 视觉 MCP → GLM-4V-Flash → 识别结果 → DeepSeek
这样做最大的意义,是不用为了偶尔看一张图片,就把整个 Agent 换成多模态模型。
DeepSeek 识图是怎么实现的?

这里首先要说明一个容易误解的地方:
这并不是让 DeepSeek 模型本身获得了视觉能力。
真正负责看图的是智谱的 GLM-4V-Flash,Reasonix 负责在需要识图时调用对应的 MCP 工具,再把返回结果交给 DeepSeek。
智谱官方目前将 GLM-4V-Flash 定义为免费的图像理解模型,支持图片描述、图片分类、图像问答等能力。
Reasonix 本身则支持 MCP、Skill 等扩展方式,因此两者可以组合起来使用。
第一步:申请智谱 API Key

首先进入智谱 AI 开放平台,注册账号并创建 API Key。
然后找到视觉模型:
|
|
这里需要特别注意,网上部分视频或文章可能会将名称写成 GLM-4.6V Flash 或 GM-4.6V Flash。
根据目前智谱官方文档,免费的视觉模型名称是:
|
|
发布文章或配置代码时,建议直接以智谱当前官方文档中的模型 ID 为准,避免因为名称变化导致 API 调用失败。
第二步:让 Reasonix 封装视觉 MCP
准备好智谱 API Key 后,可以直接让 Reasonix 帮忙创建一个调用视觉模型的 MCP Server。
例如可以给它类似这样的需求:
|
|
相比直接把 API Key 写进提示词或代码里,我更建议让它通过环境变量或者 Reasonix 的配置文件读取。
尤其是后续准备把 Skill 上传到 GitHub 时,更不能把自己的 API Key 一起提交。
第三步:把 MCP 封装成 Skill
MCP 创建完成并测试能够正常调用后,还可以进一步整理成 Reasonix Skill。
这样以后不需要每次告诉 DeepSeek:
|
|
而是让 Agent 根据任务判断什么时候需要使用视觉工具。
例如上传一张图片后直接问:
|
|

如果 Skill 的调用规则设置正确,Reasonix 就可以把图片任务交给视觉 MCP,再将分析结果返回给 DeepSeek。
实际识别效果
这次测试使用的是普通场景图片。
识别结果能够描述出图片中的:
*图片是一张浅蓝色背景的 Windows 桌面截图,上面有 4 个图标:
*右上角:深色图标,文字" 拾光集 “(可能是应用或网页快捷方式) *中间偏上:Word 文档图标,新建 DOCX 文档.docx *中间偏下:Word 文档图标,新建 DOC 文档(2).doc *底部:红色三角形图标(类似 VS Code),7.23作业(专项练习三)… *整体是学习/办公场景,主要在处理文档和作业文件。需要我针对某个图标或文件进一步分析吗?
至少在这种简单的自然场景描述任务里,可以正常工作。
不过目前没有继续进行 OCR、小字体截图、复杂图表、UI 界面定位以及大量图片的对照测试,所以还不能据此判断它在所有视觉任务中的准确率。
如果主要用途是:
- 看截图;
- 描述照片;
- 识别简单页面;
- 辅助分析图片内容;
这种方案已经具备实际使用价值。
如果是精确 OCR、复杂表格或者需要像素级判断的任务,则建议单独测试后再决定是否长期使用。
为什么不直接换一个多模态模型?
如果日常工作的大部分任务都是代码和文本,只有偶尔需要识图,这种“主模型 + 视觉工具”的方式其实更灵活。
DeepSeek 继续负责:
|
|
碰到图片才调用:
|
|
这样视觉模型更像是 DeepSeek 的一个外部工具,而不是替换 DeepSeek。
对于 Agent 来说,这种架构也比较常见:
|
|
需要什么能力,再调用什么工具。
使用前需要注意什么?
API Key 不要直接写入 Skill
这是最重要的一点。
不要把下面这种内容直接保存在公开代码中:
|
|
应该使用环境变量或本地配置文件,并确保相关文件没有提交到 GitHub。
“免费”不代表永久没有限制

智谱官方目前将 GLM-4V-Flash 标记为免费视觉模型,但免费政策、调用频率以及模型名称以后都可能调整。
因此实际使用前建议重新查看官方文档,而不是长期依赖旧教程里的价格说明。
图片实际上会发送给第三方
使用这种方案后,需要识别的图片会提交给视觉模型服务商处理。
如果图片包含:
- 客户资料;
- 公司内部文件;
- 身份信息;
- API Key;
- 密码;
- 未公开代码或业务数据;
不要在没有确认隐私要求的情况下直接上传。
是否值得给 DeepSeek 添加这个识图 Skill?
如果你正在使用 Reasonix + DeepSeek,同时又经常碰到截图、照片或者简单的图片分析任务,这种方案值得尝试。
它真正解决的问题并不是“让 DeepSeek 变成多模态模型”,而是:
给 DeepSeek Agent 增加一个可以随时调用的视觉工具。
文本和代码继续交给 DeepSeek,图片交给 GLM-4V-Flash,Reasonix 负责把两边连接起来。
从这次简单场景图片测试来看,这条调用链能够正常完成基本图片描述。不过复杂截图、OCR、图表理解等能力还有必要进一步测试。
总结
DeepSeek 没有直接识图能力,并不意味着 Agent 就一定不能处理图片。
借助 Reasonix + MCP/Skill + GLM-4V-Flash,可以把视觉模型作为一个外部工具,在需要处理图片时自动调用。
这种方式最大的优势不是“给模型升级”,而是把不同模型擅长的能力组合起来。
对于已经在 Reasonix 中使用 DeepSeek,又只是偶尔需要识图的人来说,比为了视觉能力完全更换主模型更灵活。