このサイトとは?
Marklune は、PDF、オフィス文書、Web ページなどを構造化された Markdown に変換するオンラインツールです。見出し階層、リスト、表をできるだけ保ちながら、単なる連続したプレーンテキストではなく、元の資料をノート、ナレッジベース、AI ワークフローに取り込む必要がある人向けです。ブラウザでファイルまたは公開 Web ページの URL を送信でき、API では Markdown または JSON を取得できます。スキャン文書は OCR で文字を認識できます。
主な機能
- PDF、DOCX、Word、Excel、CSV、HTML、JSON、EPUB、PowerPoint、画像などの形式を Markdown に変換できます。
- ページレイアウトから見出し、リスト、引用、多段組コンテンツを認識し、後続で分割処理できる Markdown を出力します。
- 複雑な表を GitHub Flavored Markdown の表に変換し、ドキュメントやコードプラットフォームで読みやすくします。
- スキャン PDF と画像のみの PDF に OCR を使用し、100 以上の言語をサポートするとしています。
- 公開 Web ページの URL を受け取り、ナビゲーション、広告、フッターなどを除いて主なコンテンツを抽出します。
- 結果はコピー、
.mdとしてダウンロード、または JSON としてエクスポートできます。開発者は API、バッチ処理、Webhook、署名付き URL も利用できます。
よくある利用場面
- 開発チームがレポート、マニュアル、契約書を整理し、RAG 検索基盤を作る前にファイルを分割可能な Markdown に変換します。
- 研究者が論文やスキャン資料を処理し、章、リスト、表を保ったままノートシステムへ取り込みます。
- ナレッジ管理担当者が公開ドキュメントサイトやヘルプページを Markdown にし、社内 wiki、Obsidian、Notion に集約します。
- データ・財務チームがレポート、請求書、申告書類から表を取り出し、後続の分析で使用します。
どのようなユーザーに向いていますか?
- 複数の文書形式を Markdown に統一する必要がある開発者、技術ライター、ナレッジ管理担当者に向いています。
- 見出しと表の構造を重視し、LLM のコンテキスト、ベクトル検索、エージェント入力を準備するチームに向いています。
- 公開 Web ページから本文を抽出し、手作業でのコピーと整形を減らしたい調査・運用担当者に向いています。
- PDF を元の視覚的レイアウトで時々確認するだけの人、またはログインや有料ウォールの背後にあるページを処理しなければならない人には、適性が低いです。
類似ツールとの比較
プレーンテキストだけを抽出する変換ツールと比較する際は、出力に見出し、リスト、表、多段組の順序が保持されるかを確認するとよいでしょう。スキャン文書では、OCR の言語対応と認識品質が元資料の要件を満たすかも確認が必要です。ワークフローにバッチ連携が必要な場合は、API、JSON 出力、Webhook、ファイルサイズやページ数の制限を比較できます。Web 変換では、この種のツールは通常、公開されているページだけにアクセスできる点に注意が必要です。
よくある質問
Q: Marklune は何を変換できますか?
A: 公式サイトでは、PDF、オフィス文書、表計算ファイル、HTML、JSON、EPUB、画像、スライド、公開 Web ページ URL を入力形式として挙げています。
Q: スキャン PDF を Markdown に変換できますか?
A: Marklune は、スキャン PDF や画像のみの PDF を OCR で読み取るとしています。実際の結果は、元データの鮮明さとレイアウトにも左右されます。
Q: 変換結果は RAG や AI エージェントに使えますか?
A: 出力は Markdown または JSON で提供され、後続の分割、埋め込み、ナレッジベースのワークフローに使えます。特定のモデルに適するかは、コンテンツ品質に対して検証する必要があります。
Q: Web 変換はログイン済みページに対応しますか?
A: 公式サイトでは公開 Web ページ URL を貼り付けられると説明しています。ログインや有料ウォールの背後にあるページは、公開されている対応範囲には含まれていません。









