TTS de texto para fala neural de alta fidelidade a 24kHz e API de STT de fala para texto com 99,8 por cento de precisão suportando 70 idiomas globais incluindo vietnamita inglês japonês coreano chinês francês alemão espanhol alimentado pelo Google Gemini e OpenAI ChatGPT
{
"audio": "UklGRqRQAgBXQVZFZm10IBAAAAABAAEAwF0AAIC7AAACABAAZGF0YYBQAgAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAP//AAAAAAAA//8AAP//AAD/////AAACAAAAAAD//wEAAQABAP7/AAD9//3/AAD+//7////9//z//f/8/wAAAAAAAP7/AgABAP3/+//+/wAA//8BAP//+/8AAP///v/9//z///8DAP//AQAAAP3//P////v/AgD8//7/+//9//z//v/+/////f/+/wAA/v8DAP//AgAEAAMABwAGAAUABAAAAAIAAgADAAMAAQADAAMAAgABAAAAAAD///7//f////v//f8BAAIABAAAAAEAAgABAAIAAwAAAAAA//////v///8CAP7//P/+//////8AAPz///8BAAMABAAAAAAAAQADAAAAAQAAAP///v8AAP3/AAD+/wAA/f/9//3/AQABAAQAAgD+////AwD7//7///8DAAEAAQAAAAAAAgAAAAAAAAABAAQAAAAAAP//AwACAAIA//8CAAAAAgAEAP7/BAD7////CQD9/wYABgD+/wQA/v/7/wMAAgAAAAUAAAADAAoAAgADAAAA/v/+/wEA//8AAAYA/v/8//j//P/5//z/AwAFAAAABwD+////BgACAAcAAAACAP7///8KAAIAAgD9//z/AQADAAMABAABAPz//f8AAPr/9f8AAAUABwD///T/9v/6//r//f8EAAEA//8CAP//+v8CAP7//f8DAP7//v/8//r/+//9/wEAAgAAAP7/AQACAAEAAwABAAAAAAADAAQAAgD7//3//f/+/wEABAADAAIAAQADAAUA//8BAAEAAQD9//////8BAP///v/9...",
"mimeType": "audio/wav",
"chunksSynthesized": 1,
"_note": "Response truncated for documentation purposes"
}
curl --location --request POST 'https://zylalabs.com/api/13286/multilingual+text+to+speech+tts+and+speech+to+text+stt+api/27412/text+to+speech+tts+-+multilingual+synthesis' --header 'Authorization: Bearer YOUR_API_KEY'
--data-raw '{"text": "Hello world from Zyla Labs", "provider": "gemini", "voiceName": "en-US-Journey-F"}'
{
"text": "Xin lỗi, bạn chưa đính kèm file âm thanh nào vào yêu cầu. Vui lòng tải file âm thanh lên hoặc cung cấp đường dẫn (link) để tôi có thể hỗ trợ bạn chuyển đổi thành văn bản.",
"provider": "Google Gemini",
"model": "gemini-3.1-flash-lite",
"durationSecs": 1,
"chunksProcessed": 1
}
curl --location --request POST 'https://zylalabs.com/api/13286/multilingual+text+to+speech+tts+and+speech+to+text+stt+api/27413/speech+to+text+stt+-+multilingual+audio+transcription' --header 'Authorization: Bearer YOUR_API_KEY'
--data-raw '{
"audioBase64": "UklGRiQAAABXQVZFZm10IBAAAAABAAEAQB8AAEAfAAABAAgAZGF0YQAAAAA=",
"mimeType": "audio/wav",
"lang": "vi"
}'
Após se cadastrar, cada desenvolvedor recebe uma chave de acesso à API pessoal, uma combinação única de letras e dígitos para acessar nosso endpoint de API. Para autenticar com a Texto para fala multilíngue TTS e fala para texto STT API basta incluir seu token Bearer no cabeçalho Authorization.
| Cabeçalho | Descrição |
|---|---|
Authorization
|
Obrigatório
Deve ser Bearer access_key. Veja "Sua chave de acesso à API" acima quando você estiver inscrito.
|
Sem compromisso de longo prazo. Faça upgrade, downgrade ou cancele a qualquer momento. O teste gratuito inclui até 50 requisições.
TTS de texto para fala neural de alta fidelidade a 24kHz e API de STT de fala para texto com 99,8 por cento de precisão suportando 70 idiomas globais incluindo vietnamita inglês japonês coreano chinês francês alemão espanhol. Alimentado pelo Google Gemini e OpenAI ChatGPT
O endpoint de Texto para Fala (TTS) retorna arquivos de áudio WAV de alta fidelidade sintetizados a partir de texto de entrada enquanto o endpoint de Fala para Texto (STT) retorna transcrições verbais de arquivos de áudio carregados em formato de texto
Para TTS, o campo chave é "áudio", que contém os dados de áudio. Para STT, os campos chave incluem "texto" (o texto transcrito), "provedor" (o serviço utilizado), "modelo" (o modelo específico empregado), "duraçãoSegs" (duração do áudio) e "chunkProcessados" (número de segmentos de áudio processados)
O endpoint TTS aceita parâmetros como "texto" (o texto de entrada), "língua" (a língua desejada para a síntese) e "voz" (o modelo de voz específico). O endpoint STT aceita parâmetros como "arquivoDeAudio" (o áudio a ser transcrito) e "língua" (a língua do áudio)
A resposta TTS contém um único campo "áudio" com os dados de áudio sintetizado A resposta STT é estruturada com múltiplos campos: "texto" para a transcrição "provedor" para o serviço utilizado "modelo" para o modelo de transcrição "duraçãoSegs" para o comprimento do áudio e "chunkProcessados" para o número de segmentos processados
As funcionalidades de TTS e STT são alimentadas por tecnologias avançadas do Google Gemini e OpenAI ChatGPT garantindo a síntese de áudio de alta qualidade e a precisão da transcrição
Casos de uso típicos incluem criar narrações para vídeos usando TTS gerar audiolivros e transcrever reuniões ou entrevistas com STT para documentação e acessibilidade
Os usuários podem reproduzir o áudio retornado pelo endpoint TTS diretamente em aplicativos ou salvá-lo como um arquivo Para o STT o texto transcrito pode ser usado para documentação análise ou processamento adicional em aplicativos como chatbots ou criação de conteúdo
A precisão dos dados é mantida por meio do uso de modelos neurais avançados da Google e OpenAI que são continuamente treinados e atualizados para melhorar o desempenho e se adaptar a diferentes idiomas e sotaques