OpenAI's speech-to-text model for completed audio, billed per minute. Served through the gateway's /v1/realtime WebSocket endpoint as a transcription session (intent=transcription) or as the input-audio transcription model of a speech-to-speech session, transcribing each turn once its audio is committed.
View detailed pricing and capabilities for this provider.