Unlimited-OCR Test Approfondi : Baidu Open-Source Modèle 3 Milliards de Paramètres pour PDF 100 Pages en Un Passage

Unlimited-OCR Test Approfondi : Baidu Open-Source Modèle 3 Milliards de Paramètres pour PDF 100 Pages en Un Passage

En résumé

Le Unlimited-OCR open-source de Baidu fait ce que les outils OCR traditionnels ne peuvent pas : lire un PDF de 100 pages en un seul passage, sans explosion mémoire ni perte de vitesse, avec seulement 3 milliards de paramètres. Le secret : R-SWA (Reference Sliding Window Attention) — le modèle fonctionne comme un humain qui recopie du texte, ne regardant que la source et les derniers caractères écrits.

Pourquoi l’OCR traditionnel échoue sur les longs documents

Si vous avez utilisé Tesseract ou Adobe Acrobat sur un PDF scanné de plus de 10 pages, vous connaissez ces problèmes :

  • Traitement page par page : Les moteurs OCR traitent chaque page indépendamment, remettant l’état à zéro. Les tableaux multi-pages sont coupés.
  • Explosion mémoire : Les modèles OCR end-to-end (comme DeepSeek-OCR) ont un KV Cache qui grandit linéairement avec la longueur du texte.
  • Perte de format : Mises en page multi-colonnes, tableaux multi-pages, en-têtes/pieds de page sont perdus.

Ce n’est pas que les outils soient mauvais — c’est un plafond architectural.

L’innovation clé : R-SWA (Reference Sliding Window Attention)

Travailler comme un humain qui recopie

L’équipe Baidu s’est inspirée de la façon dont les humains recopient les livres. Quand vous recopiez :

  1. Vos yeux regardent le texte source (tokens visuels)
  2. Les derniers caractères écrits sont encore en vue (tokens dans la fenêtre glissante)
  3. Le texte antérieur n’a plus besoin d’être relu (tokens sortis de la fenêtre)

C’est l’idée centrale de Reference Sliding Window Attention (R-SWA).

Détails techniques

R-SWA fait deux choses :

  1. Tokens visuels gelés : L’encodage d’image se fait une fois et reste inchangé.
  2. Fenêtre glissante sur les tokens de sortie : Chaque nouveau token ne regarde que les 128 derniers tokens générés.

Résultat : Que le document fasse 5 ou 100 pages, le KV Cache reste constant pendant le décodage.

Performance : 93% de précision, fenêtre de contexte 32K

Résultats de benchmarks

ModèleScoreNote
Unlimited-OCR93,92%OmniDocBench v1.6 SOTA
DeepSeek-OCR87,70%Modèle de référence
GPT-4o~88%Fermé
Tesseract 5~72%OCR traditionnel

Deux façons d’utiliser

Option 1 : Hugging Face Space (sans config)

Testez sur akhaliq/Unlimited-OCR.

Option 2 : Déploiement local

git clone https://github.com/baidu/Unlimited-OCR.git
cd Unlimited-OCR
conda create -n unlimited-ocr python=3.10
conda activate unlimited-ocr
pip install -r requirements.txt
python inference.py --input document.pdf --mode base --output resultat.md

Comparaison

CritèreUnlimited-OCRTesseract 5Adobe AcrobatPaddleOCR
Longs documents✅ 100 pages❌ Page/page❌ Page/page❌ Page/page
Open Source✅ MIT✅ Apache 2.0❌ Commercial✅ Apache 2.0
Offline✅✅❌✅

FAQ

Q1: VRAM nécessaire ?

~8 GB. L’architecture MoE n’active que ~500M paramètres.

Q2: Langues supportées ?

Principalement chinois/anglais, meilleure précision pour ces langues.

Q3: Usage commercial ?

Oui, licence MIT.

Q4: Temps pour 100 pages ?

~3-5 min sur RTX 4090.

Q5: Sans GPU ?

Théoriquement possible mais trop lent. Utilisez Hugging Face Space ou Apple MLX.


Cet article vous a-t-il aidé ? Plus d’outils IA dans notre Guide Ultime 2026.