> ## Documentation Index
> Fetch the complete documentation index at: https://veniceai-mintlify-ce69695c.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Modelos de fala para texto

> Modelos de fala para texto da Venice como Whisper Large V3 e ElevenLabs Scribe, com suporte multilíngue, timestamps e preços por segundo.

<div id="model-search-placeholder" data-filter="asr">
  Use o valor `id` como o parâmetro `model` nas requisições à API. 5 modelos disponíveis atualmente.

  | Modelo | ID | Por segundo de áudio | Privacidade |
  | - | - | - | - |
  | ElevenLabs Scribe V2 | `elevenlabs/scribe-v2` | \$0.0002 | Anonimizado |
  | Parakeet ASR | `nvidia/parakeet-tdt-0.6b-v3` | \$0.0001 | Privado |
  | Whisper Large V3 | `openai/whisper-large-v3` | \$0.0001 | Privado |
  | Wizper (Whisper v3) | `fal-ai/wizper` | \$0.0001 | Privado |
  | xAI Speech to Text v1 | `stt-xai-v1` | \$0.0000 | Anonimizado |
</div>

***

## Uso

Modelos de fala para texto transcrevem áudio falado em texto escrito. Eles são acessados pela [API de transcrições de áudio](/pt-BR/api-reference/endpoint/audio/transcriptions).

### Formatos de áudio suportados

`wav`, `wave`, `flac`, `m4a`, `aac`, `mp4`, `mp3`, `ogg`, `oga`, `webm`

Um arquivo é aceito quando seu tipo MIME ou sua extensão está nesta lista, e ele também precisa passar em uma verificação de magic bytes sobre os bytes enviados. Renomear um arquivo para uma extensão suportada não é suficiente.

### Formatos de resposta

| Formato | Descrição |
| - | - |
| `json` | Padrão. Retorna `{ "text": "..." }`, mais `duration` e `timestamps` quando disponíveis. |
| `text` | Texto transcrito puro. |

### Timestamps

Defina `timestamps: true` para receber dados de tempo junto com a transcrição. A resposta adiciona um objeto `timestamps` cuja granularidade depende do modelo:

| Modelo | Granularidade |
| - | - |
| `elevenlabs/scribe-v2` | `word` |
| `stt-xai-v1` | `word` |
| `openai/whisper-large-v3` | `segment` |
| `fal-ai/wizper` | `segment` |
| `nvidia/parakeet-tdt-0.6b-v3` | Nenhuma |

<Warning>
  `nvidia/parakeet-tdt-0.6b-v3` é o modelo padrão, e ele aceita `timestamps: true` sem retornar tempos. Não há erro nem aviso — a resposta simplesmente contém `text` e nada mais. Se você precisar de tempos, escolha um modelo da tabela acima e verifique se a chave `timestamps` está presente antes de lê-la.
</Warning>

Entradas de palavra são `{ "word": "...", "start": 0.0, "end": 0.5 }` e entradas de segmento são `{ "text": "...", "start": 0.0, "end": 3.2 }`, com todos os tempos em segundos.

<Note>
  A cobrança é por segundo de áudio de entrada. Veja a [API de transcrições de áudio](/pt-BR/api-reference/endpoint/audio/transcriptions) para exemplos de requisição e detalhes dos parâmetros.
</Note>


This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.