
BaiduのUnlimited OCR、KVキャッシュ制限で数十ページを一括読み取り
BaiduのUnlimited OCRは、生成される各トークンがすべての画像トークンを参照しつつ、自身の出力の直近128トークンのみを参照する「Reference Sliding Window Attention」を採用している。これにより、KVキャッシュが長さに比例して増加せず一定に保たれるため、数十ページのドキュメントを1回のパスで解析できる。ベースとなるDeepSeek OCRモデルを6ポイント上回る93%のスコアをOmniDocBench v1.5で記録し、毎秒5,580トークンで動作するほか、40ページを超えてもエラー率を0.11未満に維持する。この手法は、既存のOCRシステムが依存するページごとのキャッシュリセットループを不要にする。さらに、テキストを画像トークンに圧縮し、長文ドキュメント全体にLLMのメモリを拡張するという、より幅広い用途への可能性も示している。
出典: the-decoder.com ↗
「現在のOCRモデルは、1回のパスで約10ページ以上を処理できない」と、Baiduの研究者たちは技術報告書で記している。
Baiduの研究者、技術報告書
なぜ重要か
- → メモリキャッシュをリセットせずに40ページ以上の文書を処理し、真のエンドツーエンドOCRを可能にする。
- → 固定KVキャッシュが、現在のシステムをページごとのループに強制する計算上のボトルネックを取り除く。
- → 画像をトークンに圧縮する道を開き、長文の文書向けにLLMのコンテキストウィンドウを拡張する。
思い出すことを忘れる