415.tech
シリコンバレー発、AIとテックの最前線
BaiduのUnlimited OCR、KVキャッシュ制限で数十ページを一括読み取り

BaiduのUnlimited OCR、KVキャッシュ制限で数十ページを一括読み取り

BaiduのUnlimited OCRは、生成される各トークンがすべての画像トークンを参照しつつ、自身の出力の直近128トークンのみを参照する「Reference Sliding Window Attention」を採用している。これにより、KVキャッシュが長さに比例して増加せず一定に保たれるため、数十ページのドキュメントを1回のパスで解析できる。ベースとなるDeepSeek OCRモデルを6ポイント上回る93%のスコアをOmniDocBench v1.5で記録し、毎秒5,580トークンで動作するほか、40ページを超えてもエラー率を0.11未満に維持する。この手法は、既存のOCRシステムが依存するページごとのキャッシュリセットループを不要にする。さらに、テキストを画像トークンに圧縮し、長文ドキュメント全体にLLMのメモリを拡張するという、より幅広い用途への可能性も示している。

出典: the-decoder.com

Xでポストメール

「現在のOCRモデルは、1回のパスで約10ページ以上を処理できない」と、Baiduの研究者たちは技術報告書で記している。

Baiduの研究者、技術報告書

なぜ重要か

  • → メモリキャッシュをリセットせずに40ページ以上の文書を処理し、真のエンドツーエンドOCRを可能にする。
  • → 固定KVキャッシュが、現在のシステムをページごとのループに強制する計算上のボトルネックを取り除く。
  • → 画像をトークンに圧縮する道を開き、長文の文書向けにLLMのコンテキストウィンドウを拡張する。
思い出すことを忘れる