要約
百度のオープンソース Unlimited-OCR は、従来の OCR ツールができないことを実現:100 ページの PDF を一括で読み込み、メモリ爆発や速度低下なし、わずか 30 億パラメータで。秘密は R-SWA(Reference Sliding Window Attention)——モデルが人間のようにテキストをコピーし、原文と直近の数文字だけを見る仕組み。
従来の OCR が長い文書で苦戦する理由
10 ページ以上のスキャン PDF で Tesseract や Adobe Acrobat を使った経験があれば、以下を経験しているはず:
- ページごとの処理:OCR エンジンは各ページを個別に処理し、ページ間で状態をリセット。ページをまたぐテーブルが分断される。
- メモリ爆発:エンドツーエンド OCR モデル(DeepSeek-OCR など)の KV Cache はテキスト長に応じて線形に増加。40 ページの文書で 24GB の VRAM を消費することも。
- フォーマット喪失:マルチカラムレイアウト、ページをまたぐテーブル、ヘッダー/フッターがページごとの処理で崩れる。
これはツールの問題ではなく、アーキテクチャの限界。従来の OCR は各ページを独立したタスクとして扱い、「本全体」の視点が欠けている。
Unlimited-OCR の核心イノベーション:R-SWA 注意機構
人間がテキストをコピーするように動作
百度の研究チームは、人間が本をコピーする動作からインスピレーションを得た。本をコピーする際:
- 目は原文を見ている(視覚トークン)
- 直近に書いた数文字はまだ視野内(スライディングウィンドウ内のトークン)
- それ以前の内容は再読不要(ウィンドウから押し出されたトークン)
これが Reference Sliding Window Attention(R-SWA、参照スライディングウィンドウ注意) の核心。
技術詳細
R-SWA は 2 つのことを行う:
- 視覚トークンを固定:画像エンコーディングは一度だけ行われ、変更されない。標準的なスライディングウィンドウ注意が引き起こす画像特徴のぼやけを回避。
- 出力トークンのスライディングウィンドウ:各新規トークンは直近 128 個の生成済みトークンのみを参照。古いトークンはウィンドウから押し出される。KV Cache は固定長のキューになる。
結果:文書が 5 ページでも 100 ページでも、デコード中の KV Cache は一定。
DeepSeek-OCR との関係
Unlimited-OCR はオープンソースの DeepSeek-OCR を基盤に構築:
- DeepEncoder 視覚エンコーダを維持(1024×1024 の PDF ページを 256 トークンに圧縮)
- デコーダを MoE(Mixture of Experts)アーキテクチャに置換——総パラメータ 30 億、推論時に約 5 億のみアクティブ
- すべての標準注意層を R-SWA に置換
パフォーマンス:精度 93%、32K コンテキストウィンドウ
ベンチマーク結果
OmniDocBench v1.5/v1.6 標準 OCR ベンチマーク:
| モデル | スコア | 備考 |
|---|---|---|
| Unlimited-OCR | 93.92% | OmniDocBench v1.6 SOTA |
| DeepSeek-OCR | 87.70% | ベースライン |
| GPT-4o | ~88% | クローズドソース |
| Tesseract 5 | ~72% | 従来の OCR |
DeepSeek-OCR から 6.22 ポイント改善、40 ページ以上の文書で特に安定。
実用例
- 単一画像:「Gundam」モード(動的解像度)、高精度な単一ページ認識向け
- 複数ページ文書/PDF:「Base」モード——文書全体を一括入力、ページ分割不要
- 32K コンテキストウィンドウ:理論的に約 100 ページの標準 PDF を処理可能(1 ページ約 300 トークン)
2 つの使用方法:オンラインデモ vs ローカルデプロイメント
方法 1:Hugging Face Space(設定不要)
最も簡単な体験方法:
- akhaliq/Unlimited-OCR にアクセス
- 画像または PDF をアップロード
- 高速クロップモードまたは完全解析モードを選択
- 処理完了後、Markdown 形式の出力を取得
クイック検証に最適だが、共有 GPU リソースに制限される——長い文書はキュー待ちの可能性あり。
方法 2:ローカルデプロイメント(完全制御)
ハードウェア要件:
- GPU:NVIDIA GPU、最低 8GB VRAM(RTX 3090/4090 推奨)
- メモリ:16GB 以上
- ディスク:モデル約 6GB
インストール手順:
# 1. リポジトリをクローン
git clone https://github.com/baidu/Unlimited-OCR.git
cd Unlimited-OCR
# 2. 仮想環境を作成
conda create -n unlimited-ocr python=3.10
conda activate unlimited-ocr
# 3. 依存関係をインストール
pip install -r requirements.txt
# 4. モデルをダウンロード(Hugging Face から自動ダウンロード)
# 5. 推論を実行
python inference.py \\
--input document.pdf \\
--mode base \\
--output result.md
vLLM による高速推論(本番環境推奨):
# vLLM をインストール
pip install vllm
# サーバーを起動
python -m vllm.entrypoints.openai.api_server \\
--model baidu/Unlimited-OCR \\
--max-model-len 32768
Apple Silicon ユーザー:MLX バージョン
コミュニティが Unlimited-OCR を Apple MLX に移植(LoJexLLM/Unlimited-OCR-MLX)、M1/M2/M3 Mac でネイティブ実行可能。
比較:Unlimited-OCR vs 従来の OCR
| 項目 | Unlimited-OCR | Tesseract 5 | Adobe Acrobat OCR | PaddleOCR |
|---|---|---|---|---|
| 長文書 | ✅ 100 ページ一括 | ❌ ページごと | ❌ ページごと | ❌ ページごと |
| KV Cache | 一定(R-SWA) | N/A | N/A | N/A |
| テーブル認識 | ✅ ページ跨ぎテーブル保持 | ⚠️ 単純なテーブル | ✅ 良好 | ⚠️ 普通 |
| 数式認識 | ✅ LaTeX 出力 | ❌ 非対応 | ⚠️ 限定的 | ⚠️ 限定的 |
| モデルサイズ | ~6GB | ~30MB | クラウド | ~100MB |
| オープンソース | ✅ MIT | ✅ Apache 2.0 | ❌ 商用 | ✅ Apache 2.0 |
| オフライン | ✅ | ✅ | ❌ | ✅ |
| GPU 要件 | 8GB 以上 VRAM | CPU のみ | クラウド | オプション |
結論:Unlimited-OCR は Tesseract のような軽量ツールを置き換えるものではなく、エンドツーエンドの長文書 OCR という特定の課題を解決するもの。スキャン PDF の一括デジタイズ、契約書/財務報告書の全文抽出、学術論文の解析には、現在利用可能な最適なオープンソース選択肢。
コミュニティと最新動向
- Hugging Face Space:akhaliq/Unlimited-OCR でオンラインデモ
- Apple MLX 移植版:LoJexLLM/Unlimited-OCR-MLX で Mac ネイティブ対応
- vLLM 統合:uv-scripts/ocr にコミュニティ推論スクリプト
- GitHub:baidu/Unlimited-OCR、MIT ライセンス、活発なコミュニティ
FAQ
Q1: Unlimited-OCR にはどのくらいの VRAM が必要ですか?
推論時に約 8GB VRAM。総パラメータは 30 億だが、MoE アーキテクチャにより推論時に約 5 億のみアクティブ。R-SWA による KV Cache 一定と合わせ、実際メモリ使用量は同サイズの dense モデルよりはるかに低い。
Q2: どの言語に対応していますか?
主に中国語と英語の文書で訓練、これら 2 言語の認識精度が最高。他の言語(日本語、韓国語など)も認識可能だが、精度は若干低い可能性。
Q3: PaddleOCR との違いは?どちらを使うべき?
PaddleOCR は従来のパイプライン(検出 + 認識)——軽量、高速、単一ページ向け。Unlimited-OCR はエンドツーエンドで、長文書処理と複雑なレイアウト理解に優れる。単一の請求書や名刺なら PaddleOCR、スキャン書籍全体や長い契約書なら Unlimited-OCR が適する。
Q4: 商用利用できますか?
はい。Unlimited-OCR は MIT ライセンスで、追加認証なしで商用利用、修正、配布が可能。
Q5: 100 ページ処理にどのくらい時間がかかりますか?
GPU による。RTX 4090 で、100 ページの標準 PDF(1 ページ約 300 トークン出力)で約 3-5 分。ボトルネックは視覚エンコーディング段階、デコード段階は R-SWA により一定速度を維持。
Q6: GPU なしでも使えますか?
理論的には可能だが、非常に遅い。CPU で 30 億パラメータモデルの実行は実用的でない。GPU なしのユーザーは Hugging Face Space のオンラインデモ、または M シリーズ Mac の Apple MLX バージョンを推奨。
この記事が参考になれば幸いです!他の AI ツールをお探しなら、2026 年 AI ツール究極ガイド(50 以上の詳細レビュー)もご覧ください。