415.tech
シリコンバレー発、AIとテックの最前線
Inception、毎秒1,107トークン・26万コンテキストの拡散LLM「Mercury 2.5」をリリース

Inception、毎秒1,107トークン・26万コンテキストの拡散LLM「Mercury 2.5」をリリース

Inceptionは、広く普及しているNVIDIA GPU上で毎秒1,107トークンを達成し、26万トークンのコンテキストを備えた拡散言語モデル「Mercury 2.5」をリリースした。価格は100万入力/出力トークンあたりそれぞれ0.20ドルと0.75ドルで、リリース時は80%割引で提供される。40%の知能向上という主張よりも、本番環境での実績の方が重要だ。Augment Codeはコンテキスト圧縮のレイテンシを約150秒から27秒へと82%短縮し、コストを90%削減した。また、OpenCallのP99の音声応答時間は数分から約1秒へと短縮されている。拡散モデルは現在、呼び出しごとのレイテンシが蓄積しやすい検索、音声、コーディングエージェント内での高頻度な補助的呼び出しを処理できるほど、高速かつ安価になっている。

出典: inceptionlabs.ai

Xでポストメール

Mercuryに切り替えてから、当社のP99応答時間は数分からわずか1秒に短縮し、P50は0.4秒から0.2秒未満になった。

OpenCall 共同創業者兼CEO Oliver Silverstein

なぜ重要か

  • → 音声エージェントにおける200ミリ秒未満のレイテンシが、数秒間の停止をなくす。
  • → コンテキスト圧縮における82%のレイテンシ削減が、長文コンテキストのコーディングワークフローを可能にする。
  • → リリース時において最先端モデルより80%安価で、検索、音声、コーディングの分野で本番環境での実用性が証明されている。
スピードとスケール
このエディションの他の記事