> ## Documentation Index
> Fetch the complete documentation index at: https://veniceai-mintlify-f533effe.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Modelli Speech-to-Text

> Modelli speech-to-text Venice per trascrivere audio in testo con supporto multilingue, timestamp e un endpoint /audio/transcriptions compatibile con OpenAI.

<div id="model-search-placeholder" data-filter="asr">
  Usa il valore `id` come parametro `model` nelle richieste API. 5 modelli attualmente disponibili.

  | Modello               | ID                            | Per secondo audio | Privacy    |
  | --------------------- | ----------------------------- | ----------------- | ---------- |
  | ElevenLabs Scribe V2  | `elevenlabs/scribe-v2`        | \$0.0002          | Anonymized |
  | Parakeet ASR          | `nvidia/parakeet-tdt-0.6b-v3` | \$0.0001          | Private    |
  | Whisper Large V3      | `openai/whisper-large-v3`     | \$0.0001          | Private    |
  | Wizper (Whisper v3)   | `fal-ai/wizper`               | \$0.0001          | Private    |
  | xAI Speech to Text v1 | `stt-xai-v1`                  | \$0.0000          | Anonymized |
</div>

***

## Utilizzo

I modelli speech-to-text trascrivono l'audio parlato in testo scritto. Si accede tramite l'[API Audio Transcriptions](/api-reference/endpoint/audio/transcriptions).

### Formati audio supportati

`mp3`, `mp4`, `mpeg`, `mpga`, `m4a`, `wav`, `webm`, `flac`, `ogg`

### Formati di risposta

| Formato        | Descrizione                                                       |
| -------------- | ----------------------------------------------------------------- |
| `json`         | Predefinito. Restituisce `{ "text": "..." }`.                     |
| `text`         | Testo trascritto in chiaro.                                       |
| `srt`          | Formato sottotitoli SubRip con timestamp.                         |
| `vtt`          | Formato sottotitoli WebVTT con timestamp.                         |
| `verbose_json` | Risposta completa con timestamp a livello di segmento e metadati. |

<Note>
  I prezzi sono fatturati per secondo di audio in input. Consulta l'[API Audio Transcriptions](/api-reference/endpoint/audio/transcriptions) per esempi di richiesta e dettagli sui parametri.
</Note>
