उच्च-निष्ठता 24kHz न्यूरल टेक्स्ट-टू-स्पीच TTS और 99.8 प्रतिशत सटीक स्पीच-टू-टेक्स्ट STT API जो 70 वैश्विक भाषाओं का समर्थन करता है जिसमें वियतनामी अंग्रेजी जापानी कोरियाई चीनी फ्रेंच जर्मन स्पेनिश शामिल हैं। इसे Google Gemini और OpenAI ChatGPT द्वारा संचालित किया जाता है
{
"audio": "UklGRqRQAgBXQVZFZm10IBAAAAABAAEAwF0AAIC7AAACABAAZGF0YYBQAgAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAP//AAAAAAAA//8AAP//AAD/////AAACAAAAAAD//wEAAQABAP7/AAD9//3/AAD+//7////9//z//f/8/wAAAAAAAP7/AgABAP3/+//+/wAA//8BAP//+/8AAP///v/9//z///8DAP//AQAAAP3//P////v/AgD8//7/+//9//z//v/+/////f/+/wAA/v8DAP//AgAEAAMABwAGAAUABAAAAAIAAgADAAMAAQADAAMAAgABAAAAAAD///7//f////v//f8BAAIABAAAAAEAAgABAAIAAwAAAAAA//////v///8CAP7//P/+//////8AAPz///8BAAMABAAAAAAAAQADAAAAAQAAAP///v8AAP3/AAD+/wAA/f/9//3/AQABAAQAAgD+////AwD7//7///8DAAEAAQAAAAAAAgAAAAAAAAABAAQAAAAAAP//AwACAAIA//8CAAAAAgAEAP7/BAD7////CQD9/wYABgD+/wQA/v/7/wMAAgAAAAUAAAADAAoAAgADAAAA/v/+/wEA//8AAAYA/v/8//j//P/5//z/AwAFAAAABwD+////BgACAAcAAAACAP7///8KAAIAAgD9//z/AQADAAMABAABAPz//f8AAPr/9f8AAAUABwD///T/9v/6//r//f8EAAEA//8CAP//+v8CAP7//f8DAP7//v/8//r/+//9/wEAAgAAAP7/AQACAAEAAwABAAAAAAADAAQAAgD7//3//f/+/wEABAADAAIAAQADAAUA//8BAAEAAQD9//////8BAP///v/9...",
"mimeType": "audio/wav",
"chunksSynthesized": 1,
"_note": "Response truncated for documentation purposes"
}
curl --location --request POST 'https://zylalabs.com/api/13286/multilingual+text+to+speech+tts+and+speech+to+text+stt+api/27412/text+to+speech+tts+-+multilingual+synthesis' --header 'Authorization: Bearer YOUR_API_KEY'
--data-raw '{"text": "Hello world from Zyla Labs", "provider": "gemini", "voiceName": "en-US-Journey-F"}'
{
"text": "Xin lỗi, bạn chưa đính kèm file âm thanh nào vào yêu cầu. Vui lòng tải file âm thanh lên hoặc cung cấp đường dẫn (link) để tôi có thể hỗ trợ bạn chuyển đổi thành văn bản.",
"provider": "Google Gemini",
"model": "gemini-3.1-flash-lite",
"durationSecs": 1,
"chunksProcessed": 1
}
curl --location --request POST 'https://zylalabs.com/api/13286/multilingual+text+to+speech+tts+and+speech+to+text+stt+api/27413/speech+to+text+stt+-+multilingual+audio+transcription' --header 'Authorization: Bearer YOUR_API_KEY'
--data-raw '{
"audioBase64": "UklGRiQAAABXQVZFZm10IBAAAAABAAEAQB8AAEAfAAABAAgAZGF0YQAAAAA=",
"mimeType": "audio/wav",
"lang": "vi"
}'
साइन अप करने के बाद, प्रत्येक डेवलपर को एक पर्सनल API एक्सेस की असाइन की जाती है, जो अक्षरों और अंकों का एक यूनिक संयोजन होता है, जिसका उपयोग हमारे API एंडपॉइंट तक पहुंचने के लिए किया जाता है। प्रमाणीकरण के लिए बहुभाषी पाठ से भाषण TTS और भाषण से पाठ STT API के साथ बस अपने बेयरर टोकन को Authorization हेडर में शामिल करें।
| हेडर | विवरण |
|---|---|
Authorization
|
आवश्यक
होना चाहिए Bearer access_key. जब आप सब्सक्राइब हों तो ऊपर "Your API Access Key" देखें।
|
कोई लंबी अवधि की प्रतिबद्धता नहीं। कभी भी अपग्रेड, डाउनग्रेड या कैंसल करें। फ्री ट्रायल में 50 रिक्वेस्ट तक शामिल हैं।
उच्च-निष्ठता 24kHz न्यूरल टेक्स्ट-से-स्पीच TTS और 99.8 प्रतिशत सटीक स्पीच-से-टेक्स्ट STT API जो वियतनामी, अंग्रेजी, जापानी, कोरियाई, चीनी, फ्रेंच, जर्मन, स्पेनिश सहित 70 वैश्विक भाषाओं का समर्थन करता है। गूगल जेमिनी और ओपनएआई चैटजीपीटी द्वारा संचालित।
टेक्स्ट टू स्पीच (टीटीएस) एंडपॉइंट इनपुट टेक्स्ट से संश्लेषित उच्च गुणवत्ता वाले WAV ऑडियो फ़ाइलों को लौटाता है जबकि स्पीच टू टेक्स्ट (एसटीटी) एंडपॉइंट अपलोड की गई ऑडियो फ़ाइलों के शुद्ध लिप्यांतरणों को टेक्स्ट प्रारूप में लौटाता है
टीटीएस के लिए, मुख्य क्षेत्र "ऑडियो" है, जिसमें ऑडियो डेटा होता है। एसटीटी के लिए, प्रमुख क्षेत्रों में "पाठ" (प्रतिलिपि किया गया पाठ), "प्रदाता" (उपयोग की गई सेवा), "मॉडल" (विशिष्ट मॉडल का उपयोग किया गया), "अवधिSecs" (ऑडियो की लंबाई), और "प्रसंस्कृत भाग" (प्रसंस्कृत ऑडियो खंडों की संख्या) शामिल हैं
टीटीएस एंडपॉइंट "टेक्स्ट" (इनपुट टेक्स्ट), "भाषा" (संश्लेषण के लिए इच्छित भाषा) और "वॉयस" (विशिष्ट वॉइस मॉडल) जैसे पैरामीटर स्वीकार करता है एसटीटी एंडपॉइंट "ऑडियोफाइल" (ट्रांसक्राइब करने के लिए ऑडियो) और "भाषा" (ऑडियो की भाषा) जैसे पैरामीटर स्वीकार करता है
TTS प्रतिक्रिया में एकल क्षेत्र "ऑडियो" होता है जिसमें संश्लेषित ऑडियो डेटा होता है STT प्रतिक्रिया कई क्षेत्रों के साथ संगठित होती है "पाठ" ट्रांसक्रिप्शन के लिए "प्रदाता" उपयोग की गई सेवा के लिए "मॉडल" ट्रांसक्रिप्शन मॉडल के लिए "अवधिSecs" ऑडियो की लंबाई के लिए और "चंक्सप्रोसेस्ड" संसाधित खंडों की संख्या के लिए
TTS और STT कार्यक्षमताएँ Google Gemini और OpenAI ChatGPT की उन्नत तकनीकों द्वारा संचालित हैं जिससे उच्च गुणवत्ता वाले ऑडियो संश्लेषण और ट्रांसक्रिप्शन सटीकता सुनिश्चित होती है
प्रतिनिधि उपयोग के मामलों में वीडियो के लिए ऑडियो बनाने के लिए टीटीएस का उपयोग करना ऑडियोबुक उत्पन्न करना और बैठकें या साक्षात्कार दस्तावेज़ीकरण और पहुंच के लिए एसटीटी के साथ ट्रांसक्राइब करना शामिल है
उपयोगकर्ता TTS एंडपॉइंट द्वारा returned ऑडियो को सीधे एप्लिकेशनों में चला सकते हैं या इसे एक फ़ाइल के रूप में सहेज सकते हैं STT के लिए ट्रांसक्राइब किया गया टेक्स्ट दस्तावेजीकरण विश्लेषण या चैटबॉट्स या सामग्री निर्माण जैसी एप्लिकेशनों में आगे की प्रक्रिया के लिए इस्तेमाल किया जा सकता है
डेटा सटीकता को गूगल और ओपनएआई के उन्नत न्यूरल मॉडल्स के प्रयोग से बनाए रखा गया है जिन्हें लगातार प्रशिक्षित और अपडेट किया जाता है ताकि प्रदर्शन में सुधार और विभिन्न भाषाओं और उच्चारणों के अनुसार अनुकूलन किया जा सके