Faceless चैनल

Faceless YouTube चैनल के लिए आवाज़ कैसे चुनें और हर वीडियो में वही कैसे रखें

TTS Maker टीम11 मिनट में पढ़ें

Read in English

Faceless चैनल पर आपका चेहरा नहीं दिखता, इसलिए आवाज़ ही चैनल की एंकर है। यही एक चीज़ है जो हर वीडियो में एक जैसी रहनी चाहिए। गड़बड़ दो जगह होती है। या तो दस शब्दों का प्रीव्यू सुनकर आवाज़ चुन ली जाती है और वह आपकी स्क्रिप्ट पर जमती नहीं। या अच्छी आवाज़ मिल जाती है, पर तीन महीने बाद याद नहीं रहता कि आवाज़ कौन-सी थी और स्पीड कितनी रखी थी। इस गाइड में दोनों का हल है: आवाज़ों को बराबरी से कैसे परखें, और सेटिंग ऐसे कैसे लिखकर रखें कि पचासवाँ एपिसोड भी पहले जैसा सुनाई दे।

हर आवाज़ को एक ही स्क्रिप्ट से परखिए

प्रीव्यू क्लिप बस यह बताता है कि आवाज़ किसी और का वाक्य कैसे पढ़ती है। आपको यह जानना है कि वह आपका वाक्य कैसे पढ़ती है। इसलिए क़रीब तीस सेकंड की एक ऑडिशन स्क्रिप्ट लिखिए और जो भी आवाज़ आज़माएँ, उस पर यही स्क्रिप्ट बिना बदले चलाइए। स्क्रिप्ट बदल गई, तो आप आवाज़ों की नहीं, स्क्रिप्ट की तुलना कर रहे हैं। इसमें वे लाइनें रखिए जो आपका चैनल हर एपिसोड में बोलता है:

  • शुरुआती लाइन और चैनल का नाम। आवाज़ सबसे ज़्यादा बार यही बोलेगी।
  • एक सवाल। इससे पता चलता है कि प्रश्नचिह्न पर आवाज़ का लहजा कैसा रहता है।
  • एक संख्या, शब्दों में लिखी हुई। “पाँच मिनट”, “5 मिनट” नहीं।
  • एक-दो अंग्रेज़ी शब्द, जैसे channel या subscribe, अगर आपकी स्क्रिप्ट में ये आते हैं।
  • आख़िरी लाइन।
हिंदी की एक ऑडिशन स्क्रिप्ट (क़रीब 310 अक्षर)

नमस्कार! आप सुन रहे हैं, रोज़ एक सवाल। आज का सवाल है: हमें नींद में सपने क्यों आते हैं? अगले पाँच मिनट में हम तीन बातें समझेंगे। पहली, सपने कब आते हैं। दूसरी, कुछ सपने याद क्यों रह जाते हैं। और तीसरी, क्या सपनों का कोई मतलब होता है। वीडियो अच्छा लगे, तो channel को subscribe ज़रूर कीजिए। चलिए, शुरू करते हैं।

यहीं आज़माइए

ऑडिशन स्क्रिप्ट बॉक्स में है। पहले मधुर की आवाज़ में Convert to speech दबाइए, फिर Voice में स्वरा चुनकर दोबारा। उसके बाद चैनल का नाम और सवाल अपना लिख दीजिए।

Your generated audio will appear here.

चैनल अंग्रेज़ी में है, तो Language में English चुनिए और इसी ढंग की स्क्रिप्ट इस्तेमाल कीजिए:

यही ऑडिशन अंग्रेज़ी में

Welcome to One Question a Day. Today's question: why do we dream? In the next five minutes we will look at three things. First, when dreams happen. Second, why some dreams stay with us. And third, whether they mean anything at all. If you find this useful, subscribe to the channel. Let's begin.

तीन आवाज़ें छाँटिए, फिर एक चुनिए

बिना लॉगिन के आप Microsoft की फ़्री आवाज़ें परख सकते हैं, एक बार में 500 अक्षर और दिन में 2,000 अक्षर तक। इतने में यह स्क्रिप्ट छह बार चल जाती है। हिंदी में ऐसी दो आवाज़ें हैं: मधुर (पुरुष) और स्वरा (महिला)।

फ़्री अकाउंट बनाने पर (Telegram से लॉगिन कीजिए) Studio में बाक़ी तीन इंजन भी खुल जाते हैं। हिंदी के लिए आज की सूची में ElevenLabs की 101 और Gemini AI की 30 आवाज़ें हैं, और वॉइस पिकर में भाषा और पुरुष या महिला का फ़िल्टर है। यह स्क्रिप्ट एक बार चलाने में ElevenLabs या Cappy की आवाज़ पर क़रीब 310 क्रेडिट लगते हैं और Gemini AI की आवाज़ पर क़रीब 620। यानी नए अकाउंट के 5,000 वेलकम क्रेडिट में पहली दर पर लगभग 16 ऑडिशन हो जाते हैं, दूसरी पर 8।

पुरुष या महिला, शांत या जोशीली: यह फ़ैसला आपका है, इसका कोई तय नियम नहीं है। तीन आवाज़ें चुनिए, तीनों से ऑडिशन स्क्रिप्ट बनाइए और तीनों फ़ाइलें एक के बाद एक सुनिए। आवाज़ें हम आपकी जगह नहीं सुन सकते, इसलिए असली परख यही है: आपकी स्क्रिप्ट, आपके कान।

एक एपिसोड में आवाज़ का ख़र्च

चैनल की आवाज़ हर एपिसोड का ख़र्च है, इसलिए किसी आवाज़ की आदत पड़ने से पहले हिसाब लगा लीजिए। आठ मिनट के वीडियो की स्क्रिप्ट क़रीब 7,200 अक्षर की होती है, क्योंकि एक मिनट में लगभग 900 अक्षर बोले जाते हैं।

इंजन8 मिनट का एक एपिसोडकौन-सी सेटिंग लिखनी है
Microsoft Edgeफ़्री, रोज़ के 2,00,000 फ़्री अक्षरों के अंदरVoice, Speed, Pitch
ElevenLabs7,200 क्रेडिटVoice, Model, Stability, Similarity, Style exaggeration, Speaker boost
Cappy Voices7,200 क्रेडिटसिर्फ़ Voice। इस इंजन में कोई और सेटिंग नहीं है।
Gemini AI14,400 क्रेडिटVoice, Model, Speaking style

प्लान से ख़रीदे क्रेडिट 30 दिन तक चलते हैं, यानी प्रीमियम आवाज़ चुनने का मतलब है कि जिस भी महीने वीडियो डालेंगे, उस महीने क्रेडिट लेने होंगे। 10,00,000 क्रेडिट वाले प्लान में ElevenLabs या Cappy की आवाज़ पर ऐसे क़रीब 138 एपिसोड बनते हैं, और Gemini AI पर क़रीब 69; मौजूदा क़ीमतें प्राइसिंग पेज पर हैं। अगर यह ख़र्च साल भर नहीं उठाना चाहते, तो अभी फ़्री आवाज़ चुनिए। बाद में आवाज़ बदलेंगे, तो जो पहचान बन रही थी वह टूट जाएगी।

वॉइस कार्ड लिखिए

आवाज़ तय हो जाए, तो टेबल के आख़िरी कॉलम की हर सेटिंग लिख लीजिए। वेबसाइट पर ये Studio में Voice settings के अंदर हैं, और Telegram बॉट में Voice Settings के अंदर।

  • Microsoft Edge: Speed −50% से +100% तक और Pitch −50 Hz से +50 Hz तक जाती है।
  • ElevenLabs: Model लिखना मत भूलिए। बॉट की सेटिंग स्क्रीन ख़ुद यही कहती है: model तय करता है कि आवाज़ कैसी लगेगी, और voice तय करती है कि बोल कौन रहा है।
  • Gemini AI: Speaking style में लिखा टेक्स्ट अक्षर-अक्षर वैसा ही उतारिए। उस बॉक्स में 200 अक्षर तक आते हैं।
भरा हुआ वॉइस कार्ड

चैनल: रोज़ एक सवाल

Engine: Microsoft Edge

Voice: Madhur (Male, Hindi)

Speed: +10%

Pitch: 0 Hz

ऑडिशन स्क्रिप्ट: audition.txt

रेफ़रेंस क्लिप: reference-madhur.mp3

दूसरी पसंद: Swara, Speed +10%

तय करने की तारीख़: 4 अक्टूबर 2026

कार्ड वहीं रखिए जहाँ स्क्रिप्ट रखते हैं। जो सेटिंग आपने नहीं छेड़ी, वह भी लिखिए: नया अकाउंट Speed 0%, Pitch 0 Hz, Stability 0.50, Similarity 0.75, Style exaggeration 0 और Speaker boost चालू के साथ शुरू होता है, और साल भर बाद “मैंने तो इसे छुआ ही नहीं था” पक्के तौर पर कहना मुश्किल होता है।

TTS Maker क्या याद रखता है और क्या नहीं

कार्ड इसलिए ज़रूरी है कि टूल में सिर्फ़ आपकी अभी की सेटिंग रहती है। पहले क्या रखा था, इसका कोई रिकॉर्ड नहीं रहता।

  • Studio आपकी सेटिंग अकाउंट में सेव करता है। इंजन, आवाज़ और हर स्लाइडर वैसा ही रहता है जैसा आपने छोड़ा था, और Telegram बॉट भी वही सेटिंग इस्तेमाल करता है।
  • इस पेज वाला छोटा कन्वर्टर कुछ सेव नहीं करता। पेज दोबारा खोलते ही आवाज़ फिर डिफ़ॉल्ट पर और Speed व Pitch फिर 0 पर आ जाती हैं।
  • इंजन बदलते ही आवाज़ बदल जाती है। Studio में कोई दूसरा इंजन दबाइए, तो आवाज़ उस इंजन की पहली आवाज़ हो जाती है। वापस Microsoft Edge पर आइए, तो आवाज़ मधुर मिलेगी, पहले चाहे जो रही हो। स्लाइडर वैसे ही रहते हैं। आवाज़ नहीं रहती।
  • एक अकाउंट में सेटिंग का एक ही सेट रहता है। दो चैनल दो आवाज़ों से चलाते हैं, तो हर चैनल का अलग कार्ड रखिए।
  • History में सेटिंग नहीं दिखतीं। वेबसाइट और बॉट, दोनों में हर ऑडियो का इंजन, अक्षरों की गिनती और ख़र्च दिखता है। आवाज़, स्पीड और पिच नहीं।
  • बॉट में Reset बटन है। Voice Settings में इसे एक बार दबाने पर model, स्लाइडर, Gemini का style, स्पीड और पिच, सब डिफ़ॉल्ट पर लौट जाते हैं। आवाज़ वही रहती है, सारी ट्यूनिंग चली जाती है।

एक रिकॉर्ड ज़रूर बनता है। आपके भेजे टेक्स्ट से बॉट जो ऑडियो बनाता है, उसके कैप्शन में आवाज़ का नाम लिखा होता है। Studio में Send to my Telegram too चालू कर दें, तो वेबसाइट पर बनी ऑडियो भी आवाज़ के नाम के साथ Telegram में पहुँचती है। स्पीड और पिच कैप्शन में नहीं होतीं।

एक रेफ़रेंस क्लिप सँभालकर रखिए

फ़ाइनल सेटिंग से बनी ऑडिशन फ़ाइल डाउनलोड करके कार्ड के साथ रख लीजिए। यही फ़ाइल आपके चैनल की आवाज़ है। इसके लिए History के भरोसे मत रहिए: ऑडियो 30 दिन बाद हटा दी जाती है, तो हफ़्ते में एक वीडियो डालने वाले चैनल पर छठा एपिसोड बनाने से पहले ही पहले एपिसोड की ऑडियो जा चुकी होती है।

हर नए एपिसोड से पहले:

  1. Studio खोलिए और इंजन, आवाज़ व सेटिंग को कार्ड से मिलाइए।
  2. ऑडिशन स्क्रिप्ट बनाइए और रेफ़रेंस क्लिप के साथ सुनिए।
  3. दोनों मिलती हैं, तो एपिसोड बनाइए। नहीं मिलतीं, तो पहले सेटिंग ठीक कीजिए।

एक जैसी सेटिंग पर भी थोड़ा फ़र्क़ आ सकता है

सेटिंग एक जैसी हों, तो आवाज़ वही मिलती है। पर ElevenLabs इंजन पर पढ़ने का अंदाज़ हर बार हूबहू वही हो, यह ज़रूरी नहीं। ElevenLabs के अपने डॉक्यूमेंटेशन में लिखा है कि नतीजा nondeterministic होता है: वही आवाज़, वही सेटिंग और वही model हर बार थोड़ा अलग नतीजा देते हैं, और यह फ़र्क़ कितना होगा, इसे Stability स्लाइडर तय करता है। Stability कम हो, तो पढ़ने में ज़्यादा उतार-चढ़ाव और ज़्यादा अभिनय आता है। ज़्यादा हो, तो आवाज़ सधी हुई रहती है, और बहुत ज़्यादा करने पर एकरस लग सकती है।

चैनल की आवाज़ के लिए इसका मतलब है कि Stability बहुत कम मत रखिए। उसी पेज पर सलाह है कि Style exaggeration को आम तौर पर 0 पर ही रहने दें, और यह भी लिखा है कि इसे बढ़ाने से मॉडल कम स्थिर हो सकता है। अगर किसी एक हिस्से का जोश बाक़ी से अलग सुनाई दे, तो सेटिंग मत छेड़िए, बस वही हिस्सा दोबारा बनाइए।

AI आवाज़ आपके चैनल को क्या नहीं दे सकती

  • यह सिर्फ़ आपकी नहीं है। यहाँ की हर आवाज़ एक साझा सूची से आती है, और कोई भी दूसरा क्रिएटर वही चुन सकता है। TTS Maker में आवाज़ क्लोन करने या अपनी निजी आवाज़ बनाने का कोई फ़ीचर नहीं है। चैनल को ऐसी आवाज़ चाहिए जो किसी और के पास न हो, तो अपनी आवाज़ रिकॉर्ड कीजिए।
  • लाइब्रेरी की आवाज़ हटाई भी जा सकती है। TTS Maker एक स्वतंत्र सर्विस है। इसका ElevenLabs या किसी भी वॉइस कंपनी से कोई संबंध नहीं है, और उनकी सूचियाँ इसके हाथ में नहीं हैं। ElevenLabs के हेल्प सेंटर के मुताबिक़ Voice Library की आवाज़ का मालिक उसे शेयर करना बंद कर सकता है, और उससे पहले 30 दिन से 2 साल तक का नोटिस पीरियड होता है। कोई ख़ास आवाज़ हमेशा मिलती रहेगी, यह वादा हम नहीं कर सकते। कार्ड में दूसरी पसंद इसी वजह से लिखी जाती है।
  • YouTube के नियम इससे तय नहीं होते। मॉनेटाइज़ेशन और AI डिस्क्लोज़र की बात इस गाइड में नहीं है। हिंदी वॉइसओवर वाले गाइड में दोनों पर YouTube के अपने पेज बताए गए हैं, और स्क्रिप्ट लिखने पर भी विस्तार से बात है।

इसी चैनल के लिए छोटे क्लिप भी बनाते हैं? आवाज़ वही रखिए और कार्ड में उनके लिए एक लाइन और जोड़ दीजिए। छोटे वीडियो में स्पीड ज़्यादा क्यों रखी जाती है, यह Reels और Shorts वाले गाइड में है।

अक्सर पूछे जाने वाले सवाल

Faceless चैनल के लिए पुरुष आवाज़ रखें या महिला?

इसका कोई नियम नहीं है, और हम कोई गढ़ेंगे भी नहीं। एक ही ऑडिशन स्क्रिप्ट से दोनों तरह की एक-एक आवाज़ आज़माइए और जो आपकी स्क्रिप्ट के ढंग पर जमे, वही रखिए। कौन-सी चुनी, इससे ज़्यादा ज़रूरी यह है कि बाद में उसे बदलें नहीं।

क्या पूरा चैनल फ़्री आवाज़ पर चल सकता है?

हाँ। फ़्री अकाउंट के साथ Microsoft की आवाज़ें दिन में 2,00,000 अक्षर तक फ़्री हैं, यानी आठ मिनट की क़रीब 27 स्क्रिप्ट, और एक बार में 20,000 अक्षर तक बदले जा सकते हैं। इसमें क्रेडिट नहीं लगते, इसलिए कुछ रिन्यू भी नहीं करना पड़ता।

मुझे याद नहीं कि कौन-सी आवाज़ और स्पीड रखी थी। पता चल सकता है?

कुछ हद तक। अगर तब से कुछ बदला नहीं है, तो Studio में अकाउंट की सेव की हुई इंजन, आवाज़ और सेटिंग अब भी दिखती हैं। बदल चुके हैं, तो History में सिर्फ़ इंजन दिखता है, और Telegram पर भेजी गई ऑडियो के कैप्शन में आवाज़ का नाम होता है। स्पीड और पिच कहीं दर्ज नहीं होतीं, इसलिए किसी पुरानी फ़ाइल से सुनकर मिलाइए और फिर वॉइस कार्ड लिख लीजिए।

क्या एक जैसी सेटिंग से बने दो वीडियो बिल्कुल एक जैसे सुनाई देंगे?

आवाज़ वही रहेगी। ElevenLabs की आवाज़ों में हर बार बोलने का अंदाज़ थोड़ा अलग हो सकता है: ElevenLabs यह ख़ुद लिखता है और बताता है कि फ़र्क़ कितना होगा, यह Stability सेटिंग से तय होता है। इंजन कोई भी हो, कोई हिस्सा ठीक न लगे तो सेटिंग बदले बिना उसे दोबारा बनाइए।

क्या वेबसाइट और Telegram बॉट में एक ही आवाज़ चलती है?

हाँ। दोनों एक ही अकाउंट से चलते हैं, इसलिए एक जगह चुना गया इंजन, आवाज़ और सेटिंग दूसरी जगह भी वही रहती हैं। बॉट में आवाज़ बदलेंगे, तो Studio में भी नई आवाज़ दिखेगी।

अब अपनी आवाज़ बनाइए

फ़्री कन्वर्टर खोलिए, स्क्रिप्ट पेस्ट कीजिए और MP3 डाउनलोड कीजिए। छोटे क्लिप के लिए साइन-अप ज़रूरी नहीं।

कन्वर्टर खोलें

और गाइड

सभी गाइड →