OpenAI が GPT-Live-1 を API 向けに提供開始した。聴きながら話す全二重の音声層を担い、割り込みや相槌に応答しつつ、深い推論とツール利用はペアにしたバックエンドへ委譲する。モデル ID は gpt-live-1。エンドポイントは Live(v1/live/sessions)ほか。第三者の横断性能ベンチは公開時点で見当たらない。
委譲は delegation.type で responses(指定 Responses モデルを Live が呼ぶ)か client(アプリ側が任意のモデル/エージェントを回して結果を返す)を選ぶ。音声は audio.output.voice で指定し、既定は marin。アクセント・方言・言語の選択肢が拡充されている。ナレッジカットオフは 2025-07-31。同時セッション上限は利用ティアで 25〜500(Free は非対応)。
API 価格の比較
| モデル | 課金単位 | 音声まわりの公式単価 |
|---|---|---|
| GPT-Live-1 | セッション時間(秒単位) | $0.05 / 分(フロント音声層。バックエンドのモデル/ツールは別課金) |
| gpt-realtime-2.1 | トークン | Audio 入力 $32 / 出力 $64(各 $/1M。キャッシュ入力 $0.40) |
| gpt-realtime-2.1-mini | トークン | Audio 入力 $10 / 出力 $20(各 $/1M。キャッシュ入力 $0.30) |
GPT-Live-1 は分単価が固定で、Realtime 系はトークン従量のため会話の聞き/話し比率で実効コストが変わる。