> ## Documentation Index
> Fetch the complete documentation index at: https://veniceai-mintlify-f533effe.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Speech-to-Text-Modelle

> Venice-Speech-to-Text-Modelle transkribieren Audio mehrsprachig mit Zeitstempeln über den OpenAI-kompatiblen /audio/transcriptions-Endpoint.

<div id="model-search-placeholder" data-filter="asr">
  Verwenden Sie den `id`-Wert als `model`-Parameter in API-Anfragen. Derzeit sind 5 Modelle verfügbar.

  | Model                 | ID                            | Pro Audio-Sekunde | Privacy    |
  | --------------------- | ----------------------------- | ----------------- | ---------- |
  | ElevenLabs Scribe V2  | `elevenlabs/scribe-v2`        | \$0.0002          | Anonymized |
  | Parakeet ASR          | `nvidia/parakeet-tdt-0.6b-v3` | \$0.0001          | Private    |
  | Whisper Large V3      | `openai/whisper-large-v3`     | \$0.0001          | Private    |
  | Wizper (Whisper v3)   | `fal-ai/wizper`               | \$0.0001          | Private    |
  | xAI Speech to Text v1 | `stt-xai-v1`                  | \$0.0000          | Anonymized |
</div>

***

## Verwendung

Speech-to-Text-Modelle transkribieren gesprochenes Audio in geschriebenen Text. Sie werden über die [Audio-Transcriptions-API](/api-reference/endpoint/audio/transcriptions) aufgerufen.

### Unterstützte Audioformate

`mp3`, `mp4`, `mpeg`, `mpga`, `m4a`, `wav`, `webm`, `flac`, `ogg`

### Antwortformate

| Format         | Beschreibung                                                          |
| -------------- | --------------------------------------------------------------------- |
| `json`         | Standard. Gibt `{ "text": "..." }` zurück.                            |
| `text`         | Reiner transkribierter Text.                                          |
| `srt`          | SubRip-Untertitelformat mit Zeitstempeln.                             |
| `vtt`          | WebVTT-Untertitelformat mit Zeitstempeln.                             |
| `verbose_json` | Vollständige Antwort mit Zeitstempeln auf Segmentebene und Metadaten. |

<Note>
  Die Abrechnung erfolgt pro Sekunde Eingabe-Audio. Anfrage-Beispiele und Parameterdetails finden Sie in der [Audio-Transcriptions-API](/api-reference/endpoint/audio/transcriptions).
</Note>
