DeepSeek 本身没有直接处理图片时,一个比较灵活的办法并不是更换主模型,而是给 Agent 增加一个专门负责图片分析的工具。

这次使用的是 Reasonix + MCP/Skill + 智谱 GLM-4V-Flash。平时依然让 DeepSeek 负责对话和任务处理,只有遇到图片时,再调用视觉模型完成识别。

简单理解就是:

图片 → Reasonix → 视觉 MCP → GLM-4V-Flash → 识别结果 → DeepSeek

这样做最大的意义,是不用为了偶尔看一张图片,就把整个 Agent 换成多模态模型。

DeepSeek 识图是怎么实现的?

DeepSeek 怎么识别图片?用 Reasonix + GLM-4V-Flash 添加免费视觉能力

这里首先要说明一个容易误解的地方:

这并不是让 DeepSeek 模型本身获得了视觉能力。

真正负责看图的是智谱的 GLM-4V-Flash,Reasonix 负责在需要识图时调用对应的 MCP 工具,再把返回结果交给 DeepSeek。

智谱官方目前将 GLM-4V-Flash 定义为免费的图像理解模型,支持图片描述、图片分类、图像问答等能力。

Reasonix 本身则支持 MCP、Skill 等扩展方式,因此两者可以组合起来使用。

第一步:申请智谱 API Key

DeepSeek 怎么识别图片?用 Reasonix + GLM-4V-Flash 添加免费视觉能力

首先进入智谱 AI 开放平台,注册账号并创建 API Key。

然后找到视觉模型:

1
GLM-4V-Flash

这里需要特别注意,网上部分视频或文章可能会将名称写成 GLM-4.6V FlashGM-4.6V Flash

根据目前智谱官方文档,免费的视觉模型名称是:

1
GLM-4V-Flash

发布文章或配置代码时,建议直接以智谱当前官方文档中的模型 ID 为准,避免因为名称变化导致 API 调用失败。

第二步:让 Reasonix 封装视觉 MCP

准备好智谱 API Key 后,可以直接让 Reasonix 帮忙创建一个调用视觉模型的 MCP Server。

例如可以给它类似这样的需求:

1
2
3
4
5
6
7
8
帮我封装一个 MCP Server,用于调用智谱 GLM-4V-Flash 视觉模型。

要求:
1. API Key 通过环境变量读取,不要直接写入代码。
2. 支持传入本地图片。
3. 支持输入图片和文字问题。
4. 返回视觉模型的文本分析结果。
5. 完成后告诉我如何安装和测试。

相比直接把 API Key 写进提示词或代码里,我更建议让它通过环境变量或者 Reasonix 的配置文件读取。

尤其是后续准备把 Skill 上传到 GitHub 时,更不能把自己的 API Key 一起提交。

第三步:把 MCP 封装成 Skill

MCP 创建完成并测试能够正常调用后,还可以进一步整理成 Reasonix Skill。

这样以后不需要每次告诉 DeepSeek:

1
请调用 GLM-4V-Flash 分析这张图片

而是让 Agent 根据任务判断什么时候需要使用视觉工具。

例如上传一张图片后直接问:

1
图片上有什么内容。

DeepSeek 怎么识别图片?用 Reasonix + GLM-4V-Flash 添加免费视觉能力

如果 Skill 的调用规则设置正确,Reasonix 就可以把图片任务交给视觉 MCP,再将分析结果返回给 DeepSeek。

实际识别效果

这次测试使用的是普通场景图片。

识别结果能够描述出图片中的:

*图片是一张浅蓝色背景的 Windows 桌面截图,上面有 4 个图标:

*右上角:深色图标,文字" 拾光集 “(可能是应用或网页快捷方式) *中间偏上:Word 文档图标,新建 DOCX 文档.docx *中间偏下:Word 文档图标,新建 DOC 文档(2).doc *底部:红色三角形图标(类似 VS Code),7.23作业(专项练习三)… *整体是学习/办公场景,主要在处理文档和作业文件。需要我针对某个图标或文件进一步分析吗?

至少在这种简单的自然场景描述任务里,可以正常工作。

不过目前没有继续进行 OCR、小字体截图、复杂图表、UI 界面定位以及大量图片的对照测试,所以还不能据此判断它在所有视觉任务中的准确率。

如果主要用途是:

  • 看截图;
  • 描述照片;
  • 识别简单页面;
  • 辅助分析图片内容;

这种方案已经具备实际使用价值。

如果是精确 OCR、复杂表格或者需要像素级判断的任务,则建议单独测试后再决定是否长期使用。

为什么不直接换一个多模态模型?

如果日常工作的大部分任务都是代码和文本,只有偶尔需要识图,这种“主模型 + 视觉工具”的方式其实更灵活。

DeepSeek 继续负责:

1
2
3
4
5
6
7
代码
推理
任务规划
文字处理

碰到图片才调用:

1
GLM-4V-Flash

这样视觉模型更像是 DeepSeek 的一个外部工具,而不是替换 DeepSeek。

对于 Agent 来说,这种架构也比较常见:

1
2
3
4
5
6
DeepSeek
├── 文件工具
├── 浏览器工具
├── 搜索工具
├── 数据库工具
└── GLM-4V-Flash 视觉工具

需要什么能力,再调用什么工具。

使用前需要注意什么?

API Key 不要直接写入 Skill

这是最重要的一点。

不要把下面这种内容直接保存在公开代码中:

1
API_KEY=你的真实Key

应该使用环境变量或本地配置文件,并确保相关文件没有提交到 GitHub。

“免费”不代表永久没有限制

DeepSeek 怎么识别图片?用 Reasonix + GLM-4V-Flash 添加免费视觉能力

智谱官方目前将 GLM-4V-Flash 标记为免费视觉模型,但免费政策、调用频率以及模型名称以后都可能调整。

因此实际使用前建议重新查看官方文档,而不是长期依赖旧教程里的价格说明。

图片实际上会发送给第三方

使用这种方案后,需要识别的图片会提交给视觉模型服务商处理。

如果图片包含:

  • 客户资料;
  • 公司内部文件;
  • 身份信息;
  • API Key;
  • 密码;
  • 未公开代码或业务数据;

不要在没有确认隐私要求的情况下直接上传。

是否值得给 DeepSeek 添加这个识图 Skill?

如果你正在使用 Reasonix + DeepSeek,同时又经常碰到截图、照片或者简单的图片分析任务,这种方案值得尝试。

它真正解决的问题并不是“让 DeepSeek 变成多模态模型”,而是:

给 DeepSeek Agent 增加一个可以随时调用的视觉工具。

文本和代码继续交给 DeepSeek,图片交给 GLM-4V-Flash,Reasonix 负责把两边连接起来。

从这次简单场景图片测试来看,这条调用链能够正常完成基本图片描述。不过复杂截图、OCR、图表理解等能力还有必要进一步测试。

总结

DeepSeek 没有直接识图能力,并不意味着 Agent 就一定不能处理图片。

借助 Reasonix + MCP/Skill + GLM-4V-Flash,可以把视觉模型作为一个外部工具,在需要处理图片时自动调用。

这种方式最大的优势不是“给模型升级”,而是把不同模型擅长的能力组合起来。

对于已经在 Reasonix 中使用 DeepSeek,又只是偶尔需要识图的人来说,比为了视觉能力完全更换主模型更灵活。