这是什么网站?
Marklune 是一款将 PDF、办公文档、网页等内容转换为结构化 Markdown 的在线工具。它面向需要把原始资料纳入笔记、知识库或 AI 工作流的人,重点在于尽量保留标题层级、列表和表格,而不是只导出连续纯文本。用户可在浏览器中提交文件或公开网页 URL,也可通过 API 获取 Markdown 或 JSON;扫描件可借助 OCR 识别文字。
核心功能
- 支持 PDF、DOCX、Word、Excel、CSV、HTML、JSON、EPUB、PowerPoint、图片等格式转为 Markdown。
- 按页面布局识别标题、列表、引用和多列内容,输出可继续分块处理的 Markdown。
- 将复杂表格转换为 GitHub Flavored Markdown 表格,便于在文档或代码平台中阅读。
- 对扫描版和仅含图像的 PDF 使用 OCR,并宣称覆盖 100 多种语言。
- 可粘贴公开网页 URL,提取主要内容并排除导航、广告、页脚等页面杂项。
- 转换结果可复制、下载为
.md,或导出为 JSON;开发者还可使用 API、批处理、Webhook 和签名 URL。
常见使用场景
- 开发团队整理报告、手册或合同,在建立 RAG 检索库前将文件转换为可分块的 Markdown。
- 研究人员处理论文和扫描资料,需要保留章节、列表与表格后再导入笔记系统。
- 知识管理人员把公开文档站或帮助页面转为 Markdown,汇入内部 wiki、Obsidian 或 Notion。
- 数据与财务人员从报表、发票和申报文件中提取表格,再交由后续分析流程使用。
适合哪些用户?
- 需要将多种文档格式统一为 Markdown 的开发者、技术写作者和知识管理人员。
- 正在准备 LLM 上下文、向量检索或代理输入,且重视标题和表格结构的团队。
- 希望从公开网页提取正文、减少手动复制清理工作的研究或运营人员。
- 只需偶尔查看 PDF 原始视觉版式,或必须处理登录后、付费墙后的网页内容的用户,适用性较低。
与同类工具的对比?
与只提取纯文本的转换器相比,可重点查看输出是否保留标题、列表、表格和多栏顺序。处理扫描件时,还应确认 OCR 语言支持与识别结果是否满足资料质量要求。若工作流需要批量接入,则可比较 API、JSON 输出、Webhook 与文件大小或页数限制;对于网页转换,需注意工具通常只能读取可公开访问的页面。
常见问题
Q: Marklune 可以转换哪些内容?
A: 官网列出 PDF、办公文档、表格、HTML、JSON、EPUB、图片、幻灯片,以及公开网页 URL 等输入类型。
Q: 扫描版 PDF 能转成 Markdown 吗?
A: Marklune 表示会通过 OCR 读取扫描件或仅含图像的 PDF,实际结果仍取决于原文件清晰度和版面。
Q: 转换后能用于 RAG 或 AI 代理吗?
A: 输出为 Markdown 或 JSON,可作为后续分块、嵌入和知识库流程的输入;是否适合具体模型仍需按内容质量测试。
Q: 网页转换是否支持登录页面?
A: 官网说明可粘贴公开网页 URL,登录或付费墙后的页面不在其公开说明的支持范围内。









