415.tech
シリコンバレー発、AIとテックの最前線
OpenAI、全二重音声API「GPT-Live-1」を毎分0.05ドルで提供開始

OpenAI、全二重音声API「GPT-Live-1」を毎分0.05ドルで提供開始

OpenAIは、APIを通じて「GPT-Live-1」の一般提供を毎分0.05ドルで開始した。同モデルは聞き取りと発話を同時に行う全二重モデルであり、会話の割り込みに対応するほか、より深い理性を開発者が選択したバックエンドモデルにルーティングする。同社のベンチマークでは、ターン交代のレイテンシが1.4秒から0.8秒に短縮され、ツール呼び出しの精度は60%から87%に向上した。これにより、開発者はYelpが予約対応で運用しているパターンのように、人間と同じように割り込みを処理できる電話エージェントを構築可能になる。

出典: the-decoder.com

Xでポストメール

この音声モデルは、同時に聞き、話すことができる。「full-duplex」として知られる機能であり、すでにChatGPT内で稼働している。

The Decoder

なぜ重要か

  • → Full-duplex voiceはagent latencyを43%削減し、tool-calling accuracyは87%に向上する。これにより、自然な電話インタラクションが可能になる。
  • → Developersは現在、音声とカスタムbackendモデルを組み合わせ、ユースケースごとのreasoning depthとコストを最適化できる。
  • → Production deployments(Yelpなど)は、通話対応品質においてすでに測定可能な改善を報告している。
音声が双方向に
このエディションの他の記事