{"success":true,"audio_file":"https://s21.aconvert.com/convert/p3r68-cdx67/wma8s-k9scl.mp3","output":{"text":"Oggi che il sole.","result":{"text":"Oggi che il sole.","word_count":4,"vtt":"WEBVTT\n\n00.000 --> 01.120\nOggi che il sole.","words":[{"word":"Oggi","start":0,"end":0.3400000035762787},{"word":"che","start":0.3400000035762787,"end":0.5400000214576721},{"word":"il","start":0.5400000214576721,"end":0.7200000286102295},{"word":"sole.","start":0.7200000286102295,"end":1.1200000047683716}]}}}
curl --location --request POST 'https://zylalabs.com/api/6372/audio+to+text+converter+api/9137/conversion?url=https://s21.aconvert.com/convert/p3r68-cdx67/wma8s-k9scl.mp3' --header 'Authorization: Bearer YOUR_API_KEY'
Después de registrarte, a cada desarrollador se le asigna una clave de acceso a la API personal, una combinación única de letras y dígitos proporcionada para acceder a nuestro endpoint de la API. Para autenticarte con el Convertidor de Audio a Texto API simplemente incluye tu token de portador en el encabezado de Autorización.
| Encabezado | Descripción |
|---|---|
Autorización
|
Requerido
Debería ser Bearer access_key. Consulta "Tu Clave de Acceso a la API" arriba cuando estés suscrito.
|
Sin compromiso a largo plazo. Mejora, reduce o cancela en cualquier momento. La Prueba Gratuita incluye hasta 50 solicitudes.
(Ahorra 2 meses pagando anualmente 🎉)
El endpoint de Conversión devuelve una salida de texto estructurado derivada de la entrada de audio. Esto incluye el texto transcrito junto con metadatos como el idioma detectado, el puntaje de confianza y cualquier marca de tiempo si corresponde.
Los campos clave en los datos de respuesta normalmente incluyen "transcripción" (el texto convertido), "idioma" (idioma detectado del audio), "confianza" (puntuación de precisión) y "marcas de tiempo" (si está habilitado, indicando cuándo se pronunciaron las palabras).
El punto final de conversión requiere principalmente el parámetro "audio_url", que especifica la URL del archivo de audio que se va a transcribir. Los parámetros opcionales adicionales pueden incluir "language" para especificar el idioma deseado para la transcripción.
Los datos de respuesta están organizados en un formato JSON, con pares de clave-valor que representan la transcripción y los metadatos asociados. Esta estructura permite un fácil análisis e integración en aplicaciones.
Los casos de uso típicos incluyen transcribir reuniones, generar subtítulos para videos, crear registros escritos de entrevistas y convertir podcasts en texto para fines de accesibilidad y SEO.
La precisión de los datos se mantiene a través de avanzados algoritmos de reconocimiento de voz y un entrenamiento continuo en diversos conjuntos de datos de audio. Las actualizaciones regulares y los controles de calidad aseguran una alta fiabilidad en la transcripción en varios idiomas y acentos.
Los usuarios pueden personalizar sus solicitudes especificando parámetros opcionales como "idioma" para dirigirse a idiomas específicos para la transcripción, mejorando la precisión para contenido de audio multilingüe.
Los patrones de datos estándar incluyen una transcripción clara del contenido hablado, con posibles variaciones en longitud y estructura según la calidad del audio y la complejidad. Los usuarios deben esperar un texto coherente que coincida estrechamente con las palabras habladas.