टेक्स्ट टू स्पीच

टेक्स्ट चिपकाएँ, आवाज़ चुनें और बटन दबाएँ। सारा संश्लेषण ब्राउज़र के भीतर होता है: सिस्टम आवाज़ तुरंत बोलने लगती है, न्यूरल आवाज़ को एक बार डाउनलोड चाहिए, पर वह हर डिवाइस पर एक जैसी सुनाई देती है और फ़ाइल में सहेजी जा सकती है।

  • 0वर्ण
  • 0अनुमानित अवधि
  • 0उपलब्ध आवाज़ें

सिस्टम आवाज़ सहेजी नहीं जा सकती: ब्राउज़र उसे सीधे साउंड कार्ड को भेजता है और पेज को ऑडियो स्ट्रीम नहीं देता। न्यूरल आवाज़ आपके डिवाइस पर बनती है, इसलिए उसे WAV फ़ाइल में डाउनलोड किया जा सकता है।

कैसे इस्तेमाल करें

  1. जो टेक्स्ट पढ़ा जाना है उसे चिपकाएँ या लिखें।
  2. हर डिवाइस पर एक जैसी आवाज़ और सहेजने लायक फ़ाइल चाहिए तो न्यूरल आवाज़ चालू करें: मॉडल एक बार डाउनलोड होकर ब्राउज़र में रह जाता है।
  3. आवाज़ चुनें — सूची आपके डिवाइस में स्थापित भाषाओं से बनती है।
  4. अगर डिफ़ॉल्ट पढ़ाई बहुत तेज़ या सपाट लगे तो गति और पिच बदलें।
  5. «बोलकर पढ़ें» दबाएँ; बीच में रोककर उसी जगह से जारी रखा जा सकता है।

जानने योग्य बातें

ये आवाज़ें कहाँ से आती हैं

ब्राउज़र के पास अपनी आवाज़ें नहीं होतीं — वह ऑपरेटिंग सिस्टम से माँगता है। इसीलिए हर डिवाइस पर सूची अलग होती है: फ़ोन में आमतौर पर हर भाषा के कई स्वर होते हैं, जबकि डेस्कटॉप लिनक्स में स्पीच पैकेज लगाए बिना एक भी नहीं। इसका अर्थ यह भी है कि न अक्षरों की सीमा है न सदस्यता शुल्क: काम वही सॉफ़्टवेयर करता है जो आपके पास पहले से है।

तीन आवाज़ें, तीन तरह की कीमत

सिस्टम आवाज़ शुरू करने में कुछ नहीं लगती: वह पहले से इंस्टॉल है और बटन दबाते ही बोल देती है — पर वह कैसी सुनाई देगी, यह मशीन पर निर्भर करता है, और सादे लिनक्स डेस्कटॉप पर शायद एक भी आवाज़ न मिले। न्यूरल आवाज़ें डाउनलोड होकर आपके ही डिवाइस पर चलने वाले मॉडल हैं: अट्ठासी मेगाबाइट की Kokoro सबसे जीवंत लगती है और इस भाषा को जानती है; Piper साठ मेगाबाइट की है और साइट की हर भाषा जानती है। दोनों हाल में टेक्स्ट आपके पास रहता है और नतीजा WAV में सहेजा जा सकता है।

लंबा टेक्स्ट टुकड़ों में पढ़ा जाता है

पूरा लेख एक साथ देने पर स्पीच इंजन बीच में हार मान लेता है: क़तार को धकेला न जाए तो Chrome लगभग पंद्रह सेकंड बाद रुक जाता है, और Safari पहले कुछ सौ अक्षरों के बाद सब छोड़ देता है। इसलिए टेक्स्ट वाक्यों की सीमा पर काटकर एक-एक करके क़तार में डाला जाता है। अक्षर गिनकर काटने पर विभाजन शब्द के बीच पड़ता है, और वह हकलाने जैसा सुनाई देता है।

अक्सर पूछे जाने वाले सवाल

क्या ऑडियो को फ़ाइल के रूप में डाउनलोड कर सकते हैं?

हाँ, न्यूरल आवाज़ के साथ: वह ऑडियो पेज पर ही बनाती है, इसलिए प्लेयर के पास «WAV डाउनलोड करें» बटन दिखता है। सिस्टम आवाज़ सहेजी नहीं जा सकती — ब्राउज़र उसे सीधे साउंड कार्ड को भेजता है और पेज को ऑडियो स्ट्रीम नहीं देता, तो फ़ाइल बनाने के लिए कुछ बचता ही नहीं।

सूची में कोई आवाज़ नहीं है। अब क्या?

मतलब सिस्टम में एक भी स्थापित नहीं है। Windows में भाषा सेटिंग्स से, Android और iOS में एक्सेसिबिलिटी से, और लिनक्स में speech-dispatcher का वॉइस पैकेज लगाकर जोड़ी जाती हैं। उसके बाद पेज दोबारा लोड करें — सूची लोड होते समय पढ़ी जाती है।

वही टेक्स्ट दूसरे ब्राउज़र में अलग क्यों सुनाई देता है?

क्योंकि आवाज़ सिस्टम की होती है, पर डिफ़ॉल्ट आवाज़ का चुनाव, ठहरावों का संचालन और सटीक लय ब्राउज़र तय करता है। Chrome नेटवर्क आवाज़ें भी दे सकता है — वे ज़्यादा चिकनी लगती हैं और उनके लिए कनेक्शन चाहिए।

क्या टेक्स्ट सर्वर पर जाता है?

पेज कोई टेक्स्ट कहीं नहीं भेजता। न्यूरल आवाज़ अपना मॉडल huggingface से एक बार डाउनलोड करती है और उसके बाद बिना नेटवर्क काम करती है; आपके चिपकाए शब्द डिवाइस से बाहर नहीं जाते। नेटवर्क के रूप में चिह्नित सिस्टम आवाज़ ज़रूर निर्माता से ऑडियो माँग सकती है — इसीलिए यहाँ स्थानीय आवाज़ों को प्राथमिकता दी जाती है।

संबंधित टूल