本文へ移動
メイン ドキュメント
ドキュメント

Streaming

stream: true は受理され、完成した応答を OpenAI の chat.completion.chunk 形式(内容 1 チャンク → finish チャンク → [DONE])で配信します。裏側は非同期ジョブなので、最初のバイトは応答が出来上がってから届きます。SDK のストリーミング処理はそのまま動きます。

HTTP
POST https://api.kotoba.cloud/v1/chat/completions   {"stream": true, ...}
content-type: text/event-stream

data: {"object":"chat.completion.chunk","choices":[{"delta":{"role":"assistant","content":"..."},"finish_reason":null}]}
data: {"object":"chat.completion.chunk","choices":[{"delta":{},"finish_reason":"stop"}],"billing":"free","receiptId":"receipt-..."}
data: [DONE]

ジョブとして待つ

長い応答(32k tokens までの出力)は数分かかることがあります。同期呼び出しはサーバ側で最大 14 分待ちます。それを超えると 504 inference-timeout が返りますが、ジョブは続いており、同じリクエストを再送すると同じジョブに再接続します(決定的な job id)。

Shell
# the job API, when you want to poll yourself
curl -s -X POST https://api.kotoba.cloud/v1/research/jobs -H "idempotency-key: <uuid v4>" ...
curl -s "https://api.kotoba.cloud/v1/research/job?jobId=<uuid>"   # 202 queued/running · 200 succeeded