<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>AI节省Token on 拾光集</title>
        <link>https://www.tood.win/tags/ai%E8%8A%82%E7%9C%81token/</link>
        <description>Recent content in AI节省Token on 拾光集</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh</language>
        <lastBuildDate>Thu, 27 Aug 2026 12:53:55 +0800</lastBuildDate><atom:link href="https://www.tood.win/tags/ai%E8%8A%82%E7%9C%81token/index.xml" rel="self" type="application/rss+xml" /><item>
            <title>AI 阅读 PDF 太费 Token？先用 MarkItDown 转成 Markdown</title>
            <link>https://www.tood.win/posts/ai-yue-du-pdf-tai-fei-token-xian-yong-markitdown/</link>
            <pubDate>Wed, 05 Aug 2026 13:27:00 +0800</pubDate>
            <guid>https://www.tood.win/posts/ai-yue-du-pdf-tai-fei-token-xian-yong-markitdown/</guid>
            <description>&lt;p&gt;直接把几十页甚至上百页的 PDF 上传给 &lt;a class=&#34;link&#34; href=&#34;https://www.tood.win/tags/ai/&#34; &gt;AI&lt;/a&gt;，虽然方便，但不一定是最高效的处理方式。&lt;/p&gt;&#xA;&lt;p&gt;PDF 本质上是一种面向打印和页面展示的格式。除了正文，它还可能包含页眉、页脚、页码、分栏、坐标定位、重复标题、隐藏文本和复杂表格等信息。AI 在解析文档时，可能需要额外处理这些排版结构，从而增加上下文长度和处理难度。&lt;/p&gt;&#xA;&lt;p&gt;一种更适合长文档的工作流是：&lt;/p&gt;&#xA;&#xA;    &lt;blockquote&gt;&#xA;        &lt;p&gt;先把 PDF 转成 Markdown，再让 AI 总结、问答或提取信息。&lt;/p&gt;&#xA;&#xA;    &lt;/blockquote&gt;&#xA;&lt;p&gt;&lt;img alt=&#34;AI 阅读 PDF 太费 Token？先用 MarkItDown 转成 Markdown&#34; loading=&#34;lazy&#34; sizes=&#34;(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px&#34; src=&#34;https://www.tood.win/uploads/2026/08/13_28_58-d3b95c03.jpg&#34;&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;为什么-markdown-更适合交给-ai&#34;&gt;为什么 Markdown 更适合交给 AI？&#xA;&lt;/h2&gt;&lt;p&gt;Markdown 是结构清晰的纯文本格式，可以用简单符号保留文档中的重要层级，例如：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;标题和章节&lt;/li&gt;&#xA;&lt;li&gt;正文段落&lt;/li&gt;&#xA;&lt;li&gt;有序列表和无序列表&lt;/li&gt;&#xA;&lt;li&gt;表格&lt;/li&gt;&#xA;&lt;li&gt;链接&lt;/li&gt;&#xA;&lt;li&gt;代码块&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;与 PDF 相比，Markdown 通常会去掉大量只服务于页面展示的布局信息，让 AI 更容易识别文章结构。&lt;/p&gt;&#xA;&lt;p&gt;这样做可能带来几个好处：&lt;/p&gt;&#xA;&lt;ol&gt;&#xA;&lt;li&gt;&#xA;&lt;p&gt;&lt;strong&gt;减少无关排版信息&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;页码、重复页眉和定位信息可能在转换时被简化，输入内容更加干净。&lt;/p&gt;&#xA;&lt;/li&gt;&#xA;&lt;li&gt;&#xA;&lt;p&gt;&lt;strong&gt;方便拆分长文档&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;可以按照一级标题、二级标题或者章节拆分 Markdown，分批交给 AI，避免一次提交整本 PDF。&lt;/p&gt;&#xA;&lt;/li&gt;&#xA;&lt;li&gt;&#xA;&lt;p&gt;&lt;strong&gt;便于搜索和引用&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;Markdown 可以直接使用文本编辑器搜索，也适合导入 &lt;a class=&#34;link&#34; href=&#34;https://www.tood.win/tags/obsidian/&#34; &gt;Obsidian&lt;/a&gt;、知识库或 RAG 系统。&lt;/p&gt;&#xA;&lt;/li&gt;&#xA;&lt;li&gt;&#xA;&lt;p&gt;&lt;strong&gt;方便检查转换结果&lt;/strong&gt;&lt;/p&gt;&#xA;&lt;p&gt;在发送给 AI 之前，可以手动删除目录、版权页、重复页脚和无关章节。&lt;/p&gt;&#xA;&lt;/li&gt;&#xA;&lt;/ol&gt;&#xA;&lt;p&gt;需要注意的是，转换成 Markdown &lt;strong&gt;不代表一定会减少 &lt;a class=&#34;link&#34; href=&#34;https://www.tood.win/tags/token/&#34; &gt;Token&lt;/a&gt;&lt;/strong&gt;。最终消耗仍取决于转换后的文字长度、表格复杂度、OCR 结果以及你发送给 AI 的具体内容。&lt;/p&gt;&#xA;&lt;h2 id=&#34;markitdown-是什么&#34;&gt;MarkItDown 是什么？&#xA;&lt;/h2&gt;&lt;p&gt;MarkItDown 是微软开源的一款 Python 工具，可以把多种文件转换成 Markdown，主要面向文本分析、内容索引和大语言模型处理场景。&lt;/p&gt;&#xA;&lt;p&gt;目前项目支持的格式包括：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;PDF&lt;/li&gt;&#xA;&lt;li&gt;Word：DOCX&lt;/li&gt;&#xA;&lt;li&gt;PowerPoint：PPTX&lt;/li&gt;&#xA;&lt;li&gt;Excel：XLSX、XLS&lt;/li&gt;&#xA;&lt;li&gt;HTML&lt;/li&gt;&#xA;&lt;li&gt;CSV、JSON、XML&lt;/li&gt;&#xA;&lt;li&gt;EPUB&lt;/li&gt;&#xA;&lt;li&gt;ZIP 压缩包&lt;/li&gt;&#xA;&lt;li&gt;图片和音频等文件&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;不同格式可能需要安装对应的可选依赖。项目也提供了插件机制，可扩展 OCR 等能力。&lt;/p&gt;&#xA;&lt;h2 id=&#34;安装-markitdown&#34;&gt;安装 MarkItDown&#xA;&lt;/h2&gt;&lt;p&gt;电脑需要先安装 Python，然后在终端中运行：&lt;/p&gt;&#xA;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;&#xA;&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1&#xA;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&#xA;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-bash&#34; data-lang=&#34;bash&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;pip install &lt;span class=&#34;s2&#34;&gt;&amp;#34;markitdown[all]&amp;#34;&lt;/span&gt;&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;&#xA;&lt;/div&gt;&#xA;&lt;/div&gt;&lt;p&gt;&lt;code&gt;[all]&lt;/code&gt; 会安装全部常用格式所需的依赖。&lt;/p&gt;&#xA;&lt;p&gt;如果只需要转换 PDF，也可以只安装 PDF 相关组件：&lt;/p&gt;&#xA;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;&#xA;&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1&#xA;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&#xA;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-bash&#34; data-lang=&#34;bash&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;pip install &lt;span class=&#34;s2&#34;&gt;&amp;#34;markitdown[pdf]&amp;#34;&lt;/span&gt;&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;&#xA;&lt;/div&gt;&#xA;&lt;/div&gt;&lt;h2 id=&#34;将-pdf-转换成-markdown&#34;&gt;将 PDF 转换成 Markdown&#xA;&lt;/h2&gt;&lt;p&gt;进入 PDF 所在目录，运行：&lt;/p&gt;&#xA;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;&#xA;&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1&#xA;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&#xA;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-bash&#34; data-lang=&#34;bash&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;markitdown document.pdf -o document.md&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;&#xA;&lt;/div&gt;&#xA;&lt;/div&gt;&lt;p&gt;其中：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;&lt;code&gt;document.pdf&lt;/code&gt; 是原始 PDF 文件&lt;/li&gt;&#xA;&lt;li&gt;&lt;code&gt;document.md&lt;/code&gt; 是转换后生成的 Markdown 文件&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;转换完成后，可以使用 &lt;a class=&#34;link&#34; href=&#34;https://www.tood.win/tags/vs-code/&#34; &gt;VS Code&lt;/a&gt;、Obsidian、Typora 或普通文本编辑器打开 &lt;code&gt;.md&lt;/code&gt; 文件。&lt;/p&gt;&#xA;&lt;h2 id=&#34;使用-python-批量处理&#34;&gt;使用 Python 批量处理&#xA;&lt;/h2&gt;&lt;p&gt;需要集成到脚本或自动化流程时，可以使用 Python API：&lt;/p&gt;&#xA;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;&#xA;&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;2&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;3&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;4&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;5&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;6&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;7&#xA;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&#xA;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;kn&#34;&gt;from&lt;/span&gt; &lt;span class=&#34;nn&#34;&gt;markitdown&lt;/span&gt; &lt;span class=&#34;kn&#34;&gt;import&lt;/span&gt; &lt;span class=&#34;n&#34;&gt;MarkItDown&lt;/span&gt;&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;n&#34;&gt;converter&lt;/span&gt; &lt;span class=&#34;o&#34;&gt;=&lt;/span&gt; &lt;span class=&#34;n&#34;&gt;MarkItDown&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;()&lt;/span&gt;&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;n&#34;&gt;result&lt;/span&gt; &lt;span class=&#34;o&#34;&gt;=&lt;/span&gt; &lt;span class=&#34;n&#34;&gt;converter&lt;/span&gt;&lt;span class=&#34;o&#34;&gt;.&lt;/span&gt;&lt;span class=&#34;n&#34;&gt;convert&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;(&lt;/span&gt;&lt;span class=&#34;s2&#34;&gt;&amp;#34;document.pdf&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;)&lt;/span&gt;&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;k&#34;&gt;with&lt;/span&gt; &lt;span class=&#34;nb&#34;&gt;open&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;(&lt;/span&gt;&lt;span class=&#34;s2&#34;&gt;&amp;#34;document.md&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt; &lt;span class=&#34;s2&#34;&gt;&amp;#34;w&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt; &lt;span class=&#34;n&#34;&gt;encoding&lt;/span&gt;&lt;span class=&#34;o&#34;&gt;=&lt;/span&gt;&lt;span class=&#34;s2&#34;&gt;&amp;#34;utf-8&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;)&lt;/span&gt; &lt;span class=&#34;k&#34;&gt;as&lt;/span&gt; &lt;span class=&#34;n&#34;&gt;file&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;:&lt;/span&gt;&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;    &lt;span class=&#34;n&#34;&gt;file&lt;/span&gt;&lt;span class=&#34;o&#34;&gt;.&lt;/span&gt;&lt;span class=&#34;n&#34;&gt;write&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;(&lt;/span&gt;&lt;span class=&#34;n&#34;&gt;result&lt;/span&gt;&lt;span class=&#34;o&#34;&gt;.&lt;/span&gt;&lt;span class=&#34;n&#34;&gt;text_content&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;)&lt;/span&gt;&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;&#xA;&lt;/div&gt;&#xA;&lt;/div&gt;&lt;p&gt;这段代码会读取 &lt;code&gt;document.pdf&lt;/code&gt;，并将转换结果保存为 &lt;code&gt;document.md&lt;/code&gt;。&lt;/p&gt;&#xA;&lt;h2 id=&#34;推荐的-ai-阅读-pdf-工作流&#34;&gt;推荐的 AI 阅读 PDF 工作流&#xA;&lt;/h2&gt;&lt;p&gt;处理较长的 PDF 时，可以按照下面的步骤操作：&lt;/p&gt;&#xA;&lt;h3 id=&#34;第一步转换格式&#34;&gt;第一步：转换格式&#xA;&lt;/h3&gt;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;&#xA;&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1&#xA;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&#xA;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-bash&#34; data-lang=&#34;bash&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;markitdown document.pdf -o document.md&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;&#xA;&lt;/div&gt;&#xA;&lt;/div&gt;&lt;h3 id=&#34;第二步检查转换结果&#34;&gt;第二步：检查转换结果&#xA;&lt;/h3&gt;&lt;p&gt;重点检查：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;标题层级是否正确&lt;/li&gt;&#xA;&lt;li&gt;表格是否错位&lt;/li&gt;&#xA;&lt;li&gt;页眉、页脚是否重复&lt;/li&gt;&#xA;&lt;li&gt;是否存在乱码&lt;/li&gt;&#xA;&lt;li&gt;图片中的文字是否被遗漏&lt;/li&gt;&#xA;&lt;li&gt;多栏排版顺序是否正确&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;h3 id=&#34;第三步删除无关内容&#34;&gt;第三步：删除无关内容&#xA;&lt;/h3&gt;&lt;p&gt;可以删除：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;封面和版权声明&lt;/li&gt;&#xA;&lt;li&gt;重复目录&lt;/li&gt;&#xA;&lt;li&gt;每页重复出现的页眉和页脚&lt;/li&gt;&#xA;&lt;li&gt;与问题无关的附录&lt;/li&gt;&#xA;&lt;li&gt;大量无意义的 OCR 字符&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;h3 id=&#34;第四步按章节交给-ai&#34;&gt;第四步：按章节交给 AI&#xA;&lt;/h3&gt;&lt;p&gt;不要一次粘贴整个文档，可以先让 AI 读取目录，再按章节处理。&lt;/p&gt;&#xA;&lt;p&gt;例如：&lt;/p&gt;&#xA;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;&#xA;&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;2&#xA;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&#xA;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-text&#34; data-lang=&#34;text&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;下面是文档的第一章。请提取核心观点、关键数据和结论。&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;不要补充原文中没有的信息，并保留重要术语。&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;&#xA;&lt;/div&gt;&#xA;&lt;/div&gt;&lt;p&gt;处理技术文档时，也可以使用：&lt;/p&gt;&#xA;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;&#xA;&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1&#xA;&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;2&#xA;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&#xA;&lt;td class=&#34;lntd&#34;&gt;&#xA;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-text&#34; data-lang=&#34;text&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;请根据下面的 Markdown 内容回答问题。&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;引用结论时注明对应的章节标题；无法从原文确认的信息，请明确说明。&#xA;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;&#xA;&lt;/div&gt;&#xA;&lt;/div&gt;&lt;h2 id=&#34;哪些-pdf-适合使用-markitdown&#34;&gt;哪些 PDF 适合使用 MarkItDown？&#xA;&lt;/h2&gt;&lt;p&gt;MarkItDown 更适合：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;文字型电子书&lt;/li&gt;&#xA;&lt;li&gt;产品说明书&lt;/li&gt;&#xA;&lt;li&gt;普通研究报告&lt;/li&gt;&#xA;&lt;li&gt;合同和规章制度&lt;/li&gt;&#xA;&lt;li&gt;Word 导出的 PDF&lt;/li&gt;&#xA;&lt;li&gt;结构相对简单的论文&lt;/li&gt;&#xA;&lt;li&gt;需要导入 AI 知识库的资料&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;h2 id=&#34;哪些-pdf-可能转换效果不好&#34;&gt;哪些 PDF 可能转换效果不好？&#xA;&lt;/h2&gt;&lt;p&gt;以下类型需要谨慎检查：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;扫描版 PDF&lt;/li&gt;&#xA;&lt;li&gt;双栏或多栏论文&lt;/li&gt;&#xA;&lt;li&gt;大量公式的学术文档&lt;/li&gt;&#xA;&lt;li&gt;表格特别复杂的财务报告&lt;/li&gt;&#xA;&lt;li&gt;图片中包含大量文字的文件&lt;/li&gt;&#xA;&lt;li&gt;页面结构非常复杂的杂志&lt;/li&gt;&#xA;&lt;li&gt;依赖图表位置才能理解的资料&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;MarkItDown 的 PDF 转换并不能保证完整还原复杂版式。项目维护者也曾说明，部分 PDF 的基础转换能力相对有限；对于复杂表格、扫描文件和学术排版，转换后可能需要手动整理，或者改用带版面识别和 OCR 能力的工具。&lt;/p&gt;&#xA;&lt;p&gt;因此，不建议转换完成后直接删除原始 PDF。涉及合同、财务数据、论文公式或法律文件时，应同时对照原文核验。&lt;/p&gt;&#xA;&lt;h2 id=&#34;总结&#34;&gt;总结&#xA;&lt;/h2&gt;&lt;p&gt;将 PDF 转成 Markdown，并不是单纯更换文件后缀，而是把面向页面展示的文档，整理成更适合 AI 阅读和检索的结构化文本。&lt;/p&gt;&#xA;&lt;p&gt;对于文字较多、结构清晰的 PDF，这种方式可以减少排版干扰，并方便拆分章节、清理内容、建立知识库和进行多轮问答。&lt;/p&gt;&#xA;&lt;p&gt;实际使用时可以记住三个步骤：&lt;/p&gt;&#xA;&#xA;    &lt;blockquote&gt;&#xA;        &lt;p&gt;PDF 转 Markdown → 清理无关内容 → 按章节交给 AI&lt;/p&gt;&#xA;&#xA;    &lt;/blockquote&gt;&#xA;&lt;p&gt;这样通常比直接上传整份长 PDF 更容易控制上下文，也更方便检查 AI 的回答是否来自原文。&lt;/p&gt;&#xA;&lt;h2 id=&#34;项目地址&#34;&gt;项目地址&#xA;&lt;/h2&gt;&lt;ul&gt;&#xA;&lt;li&gt;GitHub：&lt;a class=&#34;link&#34; href=&#34;https://github.com/microsoft/markitdown&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;&#xA;    &gt;Microsoft MarkItDown&lt;/a&gt;&lt;/li&gt;&#xA;&lt;li&gt;Python 软件包：&lt;a class=&#34;link&#34; href=&#34;https://pypi.org/project/markitdown/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;&#xA;    &gt;MarkItDown on PyPI&lt;/a&gt;&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;</description>
        </item></channel>
</rss>
