Mistral OCR 4とBaidu Unlimited-OCRが同日トレンド入り — 次世代ドキュメント解析の競争を徹底解説

はじめに

2026年6月23日、ドキュメント解析の分野で2つの大きな発表が同じ日にHacker Newsの上位へと駆け上がりました。ひとつはMistralの「Mistral OCR 4」(322 points)、もうひとつはBaiduの「Unlimited-OCR」(356 points)です。どちらも単なる「文字認識ツール」ではなく、PDFや帳票・論文といった長文ドキュメントをLLMのコンテキストへ流し込むための「入力層」として設計されている点が共通しています。本記事では両者の技術的な中身を比較しながら、なぜいまOCRが再び競争の最前線になっているのか、そしてエンジニアの実務に何が変わるのかを掘り下げます。

何が起きたか — 商用APIとOSSが同日に揃い踏み

Mistral OCR 4は、同社のドキュメントインテリジェンス製品の第4世代です。公表されているベンチマークは、OmniDocBench で 93.07、OlmOCRBench で 85.20(テスト対象中トップ)、多言語クロールで 0.98。独立アノテーターによる比較では、テストした全システムに対して平均 72% の勝率でOCR 4が好まれたとされます。対応言語は10の言語グループにまたがる 170言語、価格は標準APIで $4 / 1,000ページ、Batch APIなら $2 / 1,000ページ(50%引き)です。さらに単一コンテナでの完全セルフホストにも対応し、Mistral社の公表値では単一GPUノードで毎分2,000ページの処理が可能とされています。

一方のBaidu Unlimited-OCRは、MIT License で公開されたオープンソースモデルです。スローガンは「Welcome the Era of One-Shot Long-Horizon Parsing」。最大 32,768トークン のコンテキストに対応し、複数画像やPDFを連続して一括処理できる点を売りにしています。推論モードはGundam(クロップ有効)とBase(クロップ無効)の2種類を備え、Hugging Face Transformers・SGLang・バッチスクリプト(infer.py)から利用できます。論文は arXiv 2606.23050 で公開され、DeepSeek-OCR系やPaddleOCRの研究を踏まえた設計だと明記されています。つまり「クローズドな高精度商用API」と「自前で回せるOSS」が、同じ日に並んでトレンド入りしたわけです。

技術的な背景 — OCRは「読む」から「構造化して圧縮する」へ

両者を理解する鍵は、OCRの役割がここ1〜2年で大きく変わったことにあります。Mistral OCR 4の新機能は、文字を文字列として吐き出すだけではありません。テキスト要素を矩形で位置特定する バウンディングボックス、タイトル・表・数式・署名などを判定する ブロック分類、そしてページ単位・単語単位の 信頼度スコア(confidence) を返します。これは後段のRAGやエージェントが「どこに何があり、どれくらい信頼できるか」を機械的に扱えるようにするための設計で、OCRの出力がそのまま下流の構造化データになることを狙っています。

Baidu側のキーワード「Long-Horizon Parsing」は、従来のOCRが1ページ単位に最適化されていたのに対し、一度の入力で長尺ドキュメント全体を一貫処理する という発想の転換を指します。この背景には、2025年に登場し2026年1月にDeepSeek-OCR-2へと進化した「光学圧縮(optical compression)」の潮流があります。テキストを画像領域へ写し、ビジョンエンコーダで少数の「ビジョントークン」に圧縮することで、トークン数を7〜20倍削減しつつ約97%の精度を10倍圧縮で維持する——という研究です。長文をそのままLLMに食わせる代わりに「画像として圧縮してから読む」というアプローチが、長文コンテキスト問題への現実解として定着しつつあります。Mistralの構造化出力路線と、Baiduの長尺一括処理路線は、この同じ大きな流れの異なる断面と捉えると見通しが良くなります。

エンジニアへの影響 — RAGの前処理コストとロックインを再設計できる

実務でまず効いてくるのはコストとレイテンシです。Mistralは公表ベンチマークで、図表が密な金融QAデータセットにおいて「主要なエージェント型ドキュメントパーサーと同等の精度を、約8分の1のコスト・17分の1のレイテンシで達成した」としています。RAGパイプラインの前処理(PDF→構造化テキスト)はこれまで地味にコストと時間を食う工程でしたが、ブロック分類と信頼度スコアが標準で返るなら、チャンク分割やテーブル抽出の自前実装をかなり省けます。

選定の軸も明確です。機密文書を外に出せない・推論を内製化したいならMIT LicenseのUnlimited-OCRをセルフホストする手があり、運用負荷を抑えて高精度を即使いたいならMistral OCR 4のAPI(またはセルフホスト版)が候補になります。ただしベンチマーク数値はあくまでベンダー公表値であり、Mistral自身も「実運用は自分のドキュメントで評価せよ」と注記しています。手書き・帳票・縦書き日本語など、自社データの“クセ”で精度は大きく変わるため、小さなPoCで両者を実測してから本採用するのが堅実です。

まとめ

  • Mistral OCR 4は OmniDocBench 93.07・170言語・$4/1000ページ、バウンディングボックスとブロック分類・信頼度スコアで「構造化出力」に振り切った商用API。
  • Baidu Unlimited-OCRは MIT License・32Kトークン・長尺一括処理 を売りにしたOSSで、自前推論やセルフホストに向く。
  • 両者の根底には、DeepSeek-OCR系の 光学圧縮(ビジョントークン化) という潮流があり、OCRは「文字を読む」から「ドキュメントを構造化・圧縮してLLMに渡す入力層」へと役割を変えつつある。

OCRはもはやスキャナの付属機能ではなく、LLMアプリの前処理アーキテクチャそのものです。商用APIとOSSが同日に競い合う今は、RAG前処理を一度棚卸しして自社データで測り直す好機と言えるでしょう。

今日のその他のニュース

  • VibeThinker(3Bで推論ベンチを制す) — わずか3BパラメータでOpus 4.5を推論ベンチで上回ると主張する論文がHNで345 points。小型・高効率推論モデルの潮流を象徴する一本。
  • The Coming Loop(Armin Ronacher) — Flask作者によるAIエージェント自律ループ時代の働き方論(200 points)。「ループエンジニアリングはサイバネティクスの再発見」とする日本語の論考も同時にバズった。
  • KDDIで最大1422万件の情報漏えいか — ISP事業者向けシステムへの不正アクセスでメールアドレス等が流出した可能性。同日にはマネーフォワードでも約6.3万件流出の可能性が報じられた。

ソース