MarkItDown Skill logo

MarkItDown Skill

開く

Microsoft MarkItDown 0.1.6 向けのエージェントスキル。PDF、Office、HTML、CSV、EPUB、ZIP を LLM や RAG 用の Markdown に安全な既定値で変換します。

共有:
代替ツールを見る

MarkItDown:ファイルを Markdown に変換

MarkItDown スキルは K-Dense が Claude Scientific Writer(MIT)で管理しているもので、Microsoft のオープンソースライブラリ MarkItDown をエージェントが正しく使えるようにします。MarkItDown は一般的な文書を構造を保った Markdown に変換するツールで、目的は検索、テキスト分析、LLM への入力であり、見た目の忠実な再現ではありません。スキルの現行バージョン 2.0 は MarkItDown 0.1.6(2026 年 5 月 26 日リリース)を対象とし、「組み込みコンバーターがスキャンページをローカルで OCR する」というよくある誤解を正しています。

主な機能

  • 入力に合った方法:信頼できるローカルファイルは convert_local()、バイト列は StreamInfo のヒント付き convert_stream()、自分で検証した HTTP 取得結果は convert_response()。制約の緩い convert() と convert_uri() は信頼できる入力に限ります。
  • バージョン固定のインストール:uv pip install "markitdown[all]==0.1.6"、または必要な extras だけ(pdf、docx、pptx、xlsx、xls、outlook、audio-transcription、youtube-transcription、Azure 系)。
  • 一括処理ヘルパー:batch_convert.py はフォルダをマニフェスト付きで変換し、シンボリックリンクを飛ばし、音声をクラウドの文字起こしに送るには --allow-external-services が必要です。convert_literature.py は論文 PDF を出典情報付きの front matter とともに変換し、索引も作れます。
  • OCR の選択肢:公式の markitdown-ocr プラグイン(ビジョン対応の OpenAI 互換クライアント)、Azure Document Intelligence、Azure Content Understanding。いずれも [all] ではインストールされません。
  • MCP サーバー:markitdown-mcp はツール convert_to_markdown(uri) を 1 つ公開します。スキルは STDIO を推奨し、HTTP/SSE モードには認証がないと警告しています。

使用シナリオ

  • 研究用の PDF やスライドのフォルダを RAG の索引用に準備する。
  • XLSX や DOCX の表を、エージェントが読める Markdown に抽出する。
  • 単発の文書変換のために、Claude にローカル MCP ツールを持たせる。

料金と入手方法

MarkItDown もスキルも無料で MIT ライセンスです。ローカル変換はオフラインで動きます。URL、YouTube、音声の文字起こし(SpeechRecognition 経由の Google Web Speech)、LLM による画像説明、Azure サービスはデータを外部に送り、費用がかかる場合があります。

はじめに

  1. Claude Code でプラグインを追加:/plugin marketplace add https://github.com/K-Dense-AI/claude-scientific-writer、続けて /plugin install claude-scientific-writer。
  2. uv venv --python 3.12 .venv で環境を作って有効化し、バージョン固定のパッケージをインストールします。
  3. markitdown report.pdf -o report.md を実行し、見出しや表を元の文書と見比べます。

制約:変換後のテキストは信頼できない入力であり、プロンプトインジェクションを含む可能性があります。スキャン PDF は OCR プラグインや Azure がないとほとんど文字が取れません。プラグインは同じプロセス内で Python コードを実行するため、既定では無効です。

よくある質問

text_content ではなく result.markdown を使うのはなぜ?

0.1.6 では text_content はソフト非推奨の別名で、新しいコードは result.markdown を読むべきとされています。

ページのレイアウトは保持されますか?

されません。バウンディングボックスやページ座標が必要なら、レイアウトを認識するパーサーを使うよう勧めています。

代替案

  • PDF Skill:MarkItDown ではできない PDF の結合、分割、作成を行う Anthropic のスキル。
  • DOCX Skill:Word ファイルを読むだけでなく編集します。
  • Firecrawl:ローカルファイルではなくウェブサイトを対象にした、LLM 向けのウェブクロール API。

まとめ

エージェントが多様なファイルから素早く安全にテキストを取り出す必要があるなら、MarkItDown スキルは良い既定の選択肢です。バージョンを固定し、できるだけローカルで処理し、出力は原本と照合してください。他の文書ツールは スキル一覧 へ。

コメント

まだコメントがありません。最初のコメントを投稿してください!