GPT-Live-1、話の途中で割り込める全二重音声APIが登場

SNACK 3行まとめ

  • 提供開始:2026年9月10日
  • 構成:音声対話とバックエンドの推論・ツール処理を分離
  • 料金:音声層は1分0.05ドル、秒単位で課金

スナックガールズのひとこと

AIKO: 会話を続ける音声層と裏側の処理を分けられるのは合理的です。割り込みを停止命令と誤認しない状態管理まで含めて、アプリ側の設計ですね。
レッド: 話している途中で「やっぱり別の方向で」と差し込めるなら、音声でアイデアを練る場面が面白くなりそう。待たずに軌道修正できる感覚を試してみたいな。

青緑の音声波形にGPT-Live-1 API提供開始を示すOpenAI公式カバー
画像出典:OpenAI — GPT-Live-1 API提供開始カバー

OpenAIは2026年9月10日、GPT-Live-1のAPI提供を開始しました。音声エージェントが話し終えるのを待たず、ユーザーが途中で補足したり方向を変えたりできる全二重モデルです。決まった順番で発話を交代する音声UIから、より柔軟な対話へ移行できる点が実用上の大きな変化です。

話しながら聞き、割り込みにも反応

GPT-Live-1は入力音声と出力音声を一つのモデルで扱い、相づち、沈黙、割り込み、話題の変更に反応します。従来の音声認識、言語モデル、音声合成を順番につなぐ方式とは異なる構成です。ユーザーは応答の終了を待たず、その場で説明を足したり指示を修正したりできます。 OpenAIによると、Full Duplex BenchではGPT-Realtime-2.1を30ポイント上回り、Speakの初期評価では従来のターン制システムと比べて割り込みが約80%減りました。ただし、個々のアプリで同じ結果を保証する数値ではありません。

会話役と、考えて動く役を分ける

GPT-Live-1は会話の流れを保ちながら、深い推論やツール呼び出しをGPT-6 Astraなどのテキストモデル、第三者モデル、エージェント基盤、外部サービスへ委任できます。Responsesによる管理型委任では会話コンテキストを設定済みモデルへ渡し、クライアント委任ではアプリ側が実行内容や返却結果を制御します。なお、発話への割り込みだけでバックエンド処理まで自動停止するわけではありません。権限、確認、非公開処理、キャンセル、継続的なタスク状態は開発側で管理する必要があります。

ブラウザから電話まで、用途に応じた接続

ブラウザクライアントはWebRTC、サーバー側の音声処理はWebSocketを利用でき、既存セッションへのサーバー制御や電話・SIP向けの構成にも対応します。プロンプトとセッション設定から、声の調子、速度、話し方、沈黙や背景ノイズへの挙動も調整可能です。音声層の料金は1分0.05ドルで、分単位への切り上げなしの秒単位課金。委任先のバックエンドモデルとツール利用料は別途発生します。

出典・確認日 · 確認日:2026年9月12日

関連ハッシュタグ
#GameSunakku #AI #OpenAI #GPTLive1 #VoiceAI #OpenAIAPI #音声AI #開発者向け

コメント

コメントを残す

Game Sunakku에서 더 알아보기

지금 구독하여 계속 읽고 전체 아카이브에 액세스하세요.

계속 읽기