<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>GLM-4V-Flash on 拾光集</title>
        <link>https://www.tood.win/tags/glm-4v-flash/</link>
        <description>Recent content in GLM-4V-Flash on 拾光集</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh</language>
        <lastBuildDate>Thu, 27 Aug 2026 12:53:55 +0800</lastBuildDate><atom:link href="https://www.tood.win/tags/glm-4v-flash/index.xml" rel="self" type="application/rss+xml" /><item>
            <title>DeepSeek 怎么识别图片？用 Reasonix &#43; GLM-4V-Flash 添加免费视觉能力</title>
            <link>https://www.tood.win/posts/deepseek-shi-bie-tu-pian-yong-reasonix-glm-4v-flash/</link>
            <pubDate>Fri, 07 Aug 2026 20:23:00 +0800</pubDate>
            <guid>https://www.tood.win/posts/deepseek-shi-bie-tu-pian-yong-reasonix-glm-4v-flash/</guid>
            <description>&lt;p&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.tood.win/tags/deepseek/&#34; &gt;DeepSeek&lt;/a&gt; 本身没有直接处理图片时，一个比较灵活的办法并不是更换主模型，而是给 Agent 增加一个专门负责图片分析的工具。&lt;/p&gt;&#xA;&lt;p&gt;这次使用的是 &lt;strong&gt;Reasonix + &lt;a class=&#34;link&#34; href=&#34;https://www.tood.win/tags/mcp/&#34; &gt;MCP&lt;/a&gt;/&lt;a class=&#34;link&#34; href=&#34;https://www.tood.win/tags/skill/&#34; &gt;Skill&lt;/a&gt; + 智谱 GLM-4V-Flash&lt;/strong&gt;。平时依然让 DeepSeek 负责对话和任务处理，只有遇到图片时，再调用视觉模型完成识别。&lt;/p&gt;&#xA;&lt;p&gt;简单理解就是：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;图片 → Reasonix → 视觉 MCP → GLM-4V-Flash → 识别结果 → DeepSeek&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;这样做最大的意义，是不用为了偶尔看一张图片，就把整个 Agent 换成多模态模型。&lt;/p&gt;&#xA;&lt;h2 id=&#34;deepseek-识图是怎么实现的&#34;&gt;DeepSeek 识图是怎么实现的？&#xA;&lt;/h2&gt;&lt;p&gt;&lt;img alt=&#34;DeepSeek 怎么识别图片？用 Reasonix + GLM-4V-Flash 添加免费视觉能力&#34; loading=&#34;lazy&#34; sizes=&#34;(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px&#34; src=&#34;https://www.tood.win/uploads/2026/08/f7d50e48-7186-404e-9c9a-957955b8edf6-281219d0.jpg&#34;&gt;&lt;/p&gt;&#xA;&lt;p&gt;这里首先要说明一个容易误解的地方：&lt;/p&gt;&#xA;&lt;p&gt;&lt;strong&gt;这并不是让 DeepSeek 模型本身获得了视觉能力。&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;真正负责看图的是智谱的 &lt;strong&gt;GLM-4V-Flash&lt;/strong&gt;，Reasonix 负责在需要识图时调用对应的 MCP 工具，再把返回结果交给 DeepSeek。&lt;/p&gt;&#xA;&lt;p&gt;智谱官方目前将 GLM-4V-Flash 定义为免费的图像理解模型，支持图片描述、图片分类、图像问答等能力。&lt;/p&gt;&#xA;&lt;p&gt;Reasonix 本身则支持 MCP、Skill 等扩展方式，因此两者可以组合起来使用。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第一步申请智谱-api-key&#34;&gt;第一步：申请智谱 API Key&#xA;&lt;/h2&gt;&lt;p&gt;&lt;img alt=&#34;DeepSeek 怎么识别图片？用 Reasonix + GLM-4V-Flash 添加免费视觉能力&#34; loading=&#34;lazy&#34; sizes=&#34;(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px&#34; src=&#34;https://www.tood.win/uploads/2026/08/QQ20260807-203236-0dddded0.png&#34;&gt;&lt;/p&gt;&#xA;&lt;p&gt;首先进入智谱 &lt;a class=&#34;link&#34; href=&#34;https://www.tood.win/tags/ai/&#34; &gt;AI&lt;/a&gt; 开放平台，注册账号并创建 API Key。&lt;/p&gt;&#xA;&lt;p&gt;然后找到视觉模型：&lt;/p&gt;&#xA;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;&#xA;&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1&#xA;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&#xA;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-text&#34; data-lang=&#34;text&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;GLM-4V-Flash&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;&#xA;&lt;/div&gt;&#xA;&lt;/div&gt;&lt;p&gt;这里需要特别注意，网上部分视频或文章可能会将名称写成 &lt;strong&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.tood.win/tags/glm-4-6v/&#34; &gt;GLM-4.6V&lt;/a&gt; Flash&lt;/strong&gt; 或 &lt;strong&gt;GM-4.6V Flash&lt;/strong&gt;。&lt;/p&gt;&#xA;&lt;p&gt;根据目前智谱官方文档，免费的视觉模型名称是：&lt;/p&gt;&#xA;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;&#xA;&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1&#xA;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&#xA;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-text&#34; data-lang=&#34;text&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;GLM-4V-Flash&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;&#xA;&lt;/div&gt;&#xA;&lt;/div&gt;&lt;p&gt;发布文章或配置代码时，建议直接以智谱当前官方文档中的模型 ID 为准，避免因为名称变化导致 API 调用失败。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第二步让-reasonix-封装视觉-mcp&#34;&gt;第二步：让 Reasonix 封装视觉 MCP&#xA;&lt;/h2&gt;&lt;p&gt;准备好智谱 API Key 后，可以直接让 Reasonix 帮忙创建一个调用视觉模型的 MCP Server。&lt;/p&gt;&#xA;&lt;p&gt;例如可以给它类似这样的需求：&lt;/p&gt;&#xA;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;&#xA;&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;2&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;3&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;4&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;5&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;6&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;7&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;8&#xA;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&#xA;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-text&#34; data-lang=&#34;text&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;帮我封装一个 MCP Server，用于调用智谱 GLM-4V-Flash 视觉模型。&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;要求：&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;1. API Key 通过环境变量读取，不要直接写入代码。&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;2. 支持传入本地图片。&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;3. 支持输入图片和文字问题。&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;4. 返回视觉模型的文本分析结果。&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;5. 完成后告诉我如何安装和测试。&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;&#xA;&lt;/div&gt;&#xA;&lt;/div&gt;&lt;p&gt;相比直接把 API Key 写进提示词或代码里，我更建议让它通过环境变量或者 Reasonix 的配置文件读取。&lt;/p&gt;&#xA;&lt;p&gt;尤其是后续准备把 Skill 上传到 GitHub 时，更不能把自己的 API Key 一起提交。&lt;/p&gt;&#xA;&lt;h2 id=&#34;第三步把-mcp-封装成-skill&#34;&gt;第三步：把 MCP 封装成 Skill&#xA;&lt;/h2&gt;&lt;p&gt;MCP 创建完成并测试能够正常调用后，还可以进一步整理成 Reasonix Skill。&lt;/p&gt;&#xA;&lt;p&gt;这样以后不需要每次告诉 DeepSeek：&lt;/p&gt;&#xA;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;&#xA;&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1&#xA;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&#xA;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-text&#34; data-lang=&#34;text&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;请调用 GLM-4V-Flash 分析这张图片&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;&#xA;&lt;/div&gt;&#xA;&lt;/div&gt;&lt;p&gt;而是让 Agent 根据任务判断什么时候需要使用视觉工具。&lt;/p&gt;&#xA;&lt;p&gt;例如上传一张图片后直接问：&lt;/p&gt;&#xA;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;&#xA;&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1&#xA;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&#xA;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-text&#34; data-lang=&#34;text&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;图片上有什么内容。&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;&#xA;&lt;/div&gt;&#xA;&lt;/div&gt;&lt;p&gt;&lt;img alt=&#34;DeepSeek 怎么识别图片？用 Reasonix + GLM-4V-Flash 添加免费视觉能力&#34; loading=&#34;lazy&#34; sizes=&#34;(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px&#34; src=&#34;https://www.tood.win/uploads/2026/08/QQ20260807-203510-8b82b498.png&#34;&gt;&lt;/p&gt;&#xA;&lt;p&gt;如果 Skill 的调用规则设置正确，Reasonix 就可以把图片任务交给视觉 MCP，再将分析结果返回给 DeepSeek。&lt;/p&gt;&#xA;&lt;h2 id=&#34;实际识别效果&#34;&gt;实际识别效果&#xA;&lt;/h2&gt;&lt;p&gt;这次测试使用的是普通场景图片。&lt;/p&gt;&#xA;&lt;p&gt;识别结果能够描述出图片中的：&lt;/p&gt;&#xA;&lt;p&gt;*图片是一张浅蓝色背景的 Windows 桌面截图，上面有 4 个图标：&lt;/p&gt;&#xA;&lt;p&gt;*右上角：深色图标，文字&amp;quot; 拾光集 &amp;ldquo;（可能是应用或网页快捷方式）&#xA;*中间偏上：Word 文档图标，新建 DOCX 文档.docx&#xA;*中间偏下：Word 文档图标，新建 DOC 文档(2).doc&#xA;*底部：红色三角形图标（类似 VS Code），7.23作业（专项练习三）&amp;hellip;&#xA;*整体是学习/办公场景，主要在处理文档和作业文件。需要我针对某个图标或文件进一步分析吗？&lt;/p&gt;&#xA;&lt;p&gt;至少在这种简单的自然场景描述任务里，可以正常工作。&lt;/p&gt;&#xA;&lt;p&gt;不过目前没有继续进行 OCR、小字体截图、复杂图表、UI 界面定位以及大量图片的对照测试，所以还不能据此判断它在所有视觉任务中的准确率。&lt;/p&gt;&#xA;&lt;p&gt;如果主要用途是：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;看截图；&lt;/li&gt;&#xA;&lt;li&gt;描述照片；&lt;/li&gt;&#xA;&lt;li&gt;识别简单页面；&lt;/li&gt;&#xA;&lt;li&gt;辅助分析图片内容；&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;这种方案已经具备实际使用价值。&lt;/p&gt;&#xA;&lt;p&gt;如果是精确 OCR、复杂表格或者需要像素级判断的任务，则建议单独测试后再决定是否长期使用。&lt;/p&gt;&#xA;&lt;h2 id=&#34;为什么不直接换一个多模态模型&#34;&gt;为什么不直接换一个多模态模型？&#xA;&lt;/h2&gt;&lt;p&gt;如果日常工作的大部分任务都是代码和文本，只有偶尔需要识图，这种“主模型 + 视觉工具”的方式其实更灵活。&lt;/p&gt;&#xA;&lt;p&gt;DeepSeek 继续负责：&lt;/p&gt;&#xA;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;&#xA;&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;2&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;3&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;4&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;5&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;6&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;7&#xA;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&#xA;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-text&#34; data-lang=&#34;text&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;代码&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;↓&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;推理&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;↓&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;任务规划&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;↓&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;文字处理&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;&#xA;&lt;/div&gt;&#xA;&lt;/div&gt;&lt;p&gt;碰到图片才调用：&lt;/p&gt;&#xA;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;&#xA;&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1&#xA;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&#xA;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-text&#34; data-lang=&#34;text&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;GLM-4V-Flash&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;&#xA;&lt;/div&gt;&#xA;&lt;/div&gt;&lt;p&gt;这样视觉模型更像是 DeepSeek 的一个外部工具，而不是替换 DeepSeek。&lt;/p&gt;&#xA;&lt;p&gt;对于 Agent 来说，这种架构也比较常见：&lt;/p&gt;&#xA;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;&#xA;&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;2&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;3&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;4&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;5&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;6&#xA;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&#xA;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-text&#34; data-lang=&#34;text&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;DeepSeek&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;├── 文件工具&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;├── 浏览器工具&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;├── 搜索工具&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;├── 数据库工具&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;└── GLM-4V-Flash 视觉工具&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;&#xA;&lt;/div&gt;&#xA;&lt;/div&gt;&lt;p&gt;需要什么能力，再调用什么工具。&lt;/p&gt;&#xA;&lt;h2 id=&#34;使用前需要注意什么&#34;&gt;使用前需要注意什么？&#xA;&lt;/h2&gt;&lt;h3 id=&#34;api-key-不要直接写入-skill&#34;&gt;API Key 不要直接写入 Skill&#xA;&lt;/h3&gt;&lt;p&gt;这是最重要的一点。&lt;/p&gt;&#xA;&lt;p&gt;不要把下面这种内容直接保存在公开代码中：&lt;/p&gt;&#xA;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;&#xA;&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1&#xA;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&#xA;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-text&#34; data-lang=&#34;text&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;API_KEY=你的真实Key&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;&#xA;&lt;/div&gt;&#xA;&lt;/div&gt;&lt;p&gt;应该使用环境变量或本地配置文件，并确保相关文件没有提交到 GitHub。&lt;/p&gt;&#xA;&lt;h3 id=&#34;免费不代表永久没有限制&#34;&gt;“免费”不代表永久没有限制&#xA;&lt;/h3&gt;&lt;p&gt;&lt;img alt=&#34;DeepSeek 怎么识别图片？用 Reasonix + GLM-4V-Flash 添加免费视觉能力&#34; loading=&#34;lazy&#34; sizes=&#34;(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px&#34; src=&#34;https://www.tood.win/uploads/2026/08/QQ20260807-203753-1d95fe76.png&#34;&gt;&lt;/p&gt;&#xA;&lt;p&gt;智谱官方目前将 GLM-4V-Flash 标记为免费视觉模型，但免费政策、调用频率以及模型名称以后都可能调整。&lt;/p&gt;&#xA;&lt;p&gt;因此实际使用前建议重新查看官方文档，而不是长期依赖旧教程里的价格说明。&lt;/p&gt;&#xA;&lt;h3 id=&#34;图片实际上会发送给第三方&#34;&gt;图片实际上会发送给第三方&#xA;&lt;/h3&gt;&lt;p&gt;使用这种方案后，需要识别的图片会提交给视觉模型服务商处理。&lt;/p&gt;&#xA;&lt;p&gt;如果图片包含：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;客户资料；&lt;/li&gt;&#xA;&lt;li&gt;公司内部文件；&lt;/li&gt;&#xA;&lt;li&gt;身份信息；&lt;/li&gt;&#xA;&lt;li&gt;API Key；&lt;/li&gt;&#xA;&lt;li&gt;密码；&lt;/li&gt;&#xA;&lt;li&gt;未公开代码或业务数据；&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;不要在没有确认隐私要求的情况下直接上传。&lt;/p&gt;&#xA;&lt;h2 id=&#34;是否值得给-deepseek-添加这个识图-skill&#34;&gt;是否值得给 DeepSeek 添加这个识图 Skill？&#xA;&lt;/h2&gt;&lt;p&gt;如果你正在使用 Reasonix + DeepSeek，同时又经常碰到截图、照片或者简单的图片分析任务，这种方案值得尝试。&lt;/p&gt;&#xA;&lt;p&gt;它真正解决的问题并不是“让 DeepSeek 变成多模态模型”，而是：&lt;/p&gt;&#xA;&#xA;    &lt;blockquote&gt;&#xA;        &lt;p&gt;&lt;strong&gt;给 DeepSeek Agent 增加一个可以随时调用的视觉工具。&lt;/strong&gt;&lt;/p&gt;&#xA;&#xA;    &lt;/blockquote&gt;&#xA;&lt;p&gt;文本和代码继续交给 DeepSeek，图片交给 GLM-4V-Flash，Reasonix 负责把两边连接起来。&lt;/p&gt;&#xA;&lt;p&gt;从这次简单场景图片测试来看，这条调用链能够正常完成基本图片描述。不过复杂截图、OCR、图表理解等能力还有必要进一步测试。&lt;/p&gt;&#xA;&lt;h2 id=&#34;总结&#34;&gt;总结&#xA;&lt;/h2&gt;&lt;p&gt;DeepSeek 没有直接识图能力，并不意味着 Agent 就一定不能处理图片。&lt;/p&gt;&#xA;&lt;p&gt;借助 &lt;strong&gt;Reasonix + MCP/Skill + GLM-4V-Flash&lt;/strong&gt;，可以把视觉模型作为一个外部工具，在需要处理图片时自动调用。&lt;/p&gt;&#xA;&lt;p&gt;这种方式最大的优势不是“给模型升级”，而是把不同模型擅长的能力组合起来。&lt;/p&gt;&#xA;&lt;p&gt;对于已经在 Reasonix 中使用 DeepSeek，又只是偶尔需要识图的人来说，比为了视觉能力完全更换主模型更灵活。&lt;/p&gt;&#xA;</description>
        </item></channel>
</rss>
