ट्यूटोरियल

अपलोड किए गए ऑडियो से तस्वीर को बोलता हुआ कैसे बनाएं

FreeLipSync TeamFreeLipSync Team|5 min read
काल्पनिक दक्षिण पूर्व एशियाई पॉडकास्ट होस्ट पोर्ट्रेट का उपयोग अपलोड-ऑडियो टॉकिंग-फोटो ट्यूटोरियल के लिए किया जाता है

अपलोड किए गए ऑडियो के साथ एक फोटो टॉक बनाने के लिए, एक स्पष्ट पोर्ट्रेट चुनें, एक साफ एमपी3 या डब्ल्यूएवी रिकॉर्डिंग तैयार करें, दोनों को Audio to Talking Photo पर अपलोड करें और जेनरेट करें। इस मार्ग का उपयोग तब करें जब रिकॉर्डिंग की आवाज, गति, विराम और जोर पहले से ही अंतिम हो।

जिसकी आपको जरूरत है

  • स्रोत छवि: स्रोत एक काल्पनिक दक्षिण पूर्व एशियाई पॉडकास्ट होस्ट है जिसकी सीधे एक साफ स्टूडियो में फोटो खींची गई है। माइक्रोफ़ोन नीचे और किनारे पर होता है इसलिए यह मुंह को ढके बिना संदर्भ स्थापित करता है।
  • इस उदाहरण में प्रयुक्त इनपुट ऑडियो: एमपी3 को इस प्रदर्शन के लिए संश्लेषित किया गया था, लेकिन यह आपके द्वारा अपलोड किए गए किसी भी अंतिम वॉयसओवर की तरह व्यवहार करता है। मृत हवा को ट्रिम करें, आकस्मिक क्लिक हटाएं, और पीढ़ी से पहले स्पष्ट वॉल्यूम जंप को सामान्य करें; लिप सिंक आपके द्वारा प्रदान की गई रिकॉर्डिंग का अनुसरण करता है।
  • औजार: Audio to Talking Photo

केवल वही रिकॉर्डिंग और पोर्ट्रेट अपलोड करें जिसके उपयोग के लिए आप अधिकृत हैं। बिना अनुमति के किसी व्यक्ति की आवाज का क्लोन या नकल न करें और जहां संदर्भ की आवश्यकता हो वहां सिंथेटिक मीडिया का खुलासा करें।

स्रोत छवि और इनपुट

काल्पनिक दक्षिण पूर्व एशियाई पॉडकास्ट होस्ट पोर्ट्रेट का उपयोग अपलोड-ऑडियो टॉकिंग-फोटो ट्यूटोरियल के लिए किया जाता है

इस उदाहरण में प्रयुक्त इनपुट ऑडियो

यह इस स्थानीयकृत डेमो ऑडियो में इस्तेमाल की गई सटीक स्क्रिप्ट है:

यह क्लिप अपलोड की गई रिकॉर्डिंग की गति और ठहराव को बिल्कुल वैसा ही रखती है। जब आवाज़ पहले से सही लगे और केवल फोटो को उससे सिंक करना हो, तब यह तरीका इस्तेमाल करें।

कच्चा परिणाम

असंपादित आउटपुट एमपी3 की ताल और ठहराव को बनाए रखता है। टेक्स्ट-फर्स्ट वर्कफ़्लो से यह मुख्य अंतर है: फोटो एनिमेटेड होने से पहले प्रदर्शन ऑडियो संपादक या रिकॉर्डिंग सत्र में तय किया जाता है।

समर्पित वीडियो दृश्य पृष्ठ खोलें

चरण-दर-चरण कार्यप्रवाह

  1. एक स्पष्ट स्रोत छवि तैयार करें — एक सामने की ओर वाली छवि का उपयोग करें जिसमें मुंह दिखाई दे रहा हो, रोशनी भी समान हो और कोई हाथ, माइक्रोफोन या भारी छाया होंठों को न ढक रही हो।
  2. मिलान करने वाले FreeLipSync टूल को खोलें — इस वर्कफ़्लो के लिए लिंक किया गया टूल खोलें. पुष्टि करें कि इसका इनपुट मोड आपके स्रोत से मेल खाता है: पाठ, अपलोड किया गया भाषण, या गीत ऑडियो।
  3. स्क्रिप्ट या ऑडियो इनपुट जोड़ें — एक संक्षिप्त स्वच्छ इनपुट जोड़ें. पहले परीक्षण को सरल रखें ताकि यह बताना आसान हो कि छवि और ऑडियो एक अच्छा मेल हैं या नहीं।
  4. लिप-सिंक परिणाम उत्पन्न करें — एक साथ कई चर बदले बिना एक कच्चा परिणाम उत्पन्न करें। एक नियंत्रित पहला पास समस्या निवारण को बहुत तेज़ बनाता है।
  5. प्रकाशन से पहले पूर्ण परिणाम की समीक्षा करें — आरंभ से अंत तक ध्वनि के साथ देखें. मुंह की दृश्यता, समय, उच्चारण और क्या क्लिप स्रोत का ईमानदारी से प्रतिनिधित्व करता है, इसकी जांच करें।

यह सेटअप क्यों काम करता है

जब उच्चारण, भावना, समय, या एक विशिष्ट अनुमोदित आवाज मायने रखती है तो अपलोड किया गया ऑडियो सच्चाई का बेहतर स्रोत है। एक संक्षिप्त क्लीन टेक से यह पता लगाना भी आसान हो जाता है कि कोई समस्या रिकॉर्डिंग या छवि से संबंधित है या नहीं।

गुणवत्ता जांच सूची

  • अपलोड करने से पहले अवांछित चुप्पी और क्लिक को ट्रिम करें; रिकॉर्डिंग को सुधारने के लिए छवि एनीमेशन की अपेक्षा न करें।
  • पहले परीक्षण के दौरान सीमित पृष्ठभूमि संगीत के साथ आवाज को केंद्रित और सुगम रखें।
  • स्रोत छवि में माइक्रोफ़ोन, हाथ और कैप्शन को दृश्यमान मुख से दूर रखें।

बचने योग्य सामान्य गलतियाँ

  • केवल वही रिकॉर्डिंग और पोर्ट्रेट अपलोड करें जिसके उपयोग के लिए आप अधिकृत हैं। बिना अनुमति के किसी व्यक्ति की आवाज का क्लोन या नकल न करें और जहां संदर्भ की आवश्यकता हो वहां सिंथेटिक मीडिया का खुलासा करें।
  • किसी लंबी स्क्रिप्ट या गाने से शुरुआत न करें। एक छोटा सा पहला पास आपको तेज़, अधिक उपयोगी गुणवत्ता वाला सिग्नल देता है।
  • जब तक आपके पास आवश्यक अनुमति या लाइसेंस न हो, कोई चेहरा, चरित्र, रिकॉर्डिंग या गीत प्रकाशित न करें।

प्रश्न लोग पूछते हैं

क्या अपलोड किया गया ऑडियो टेक्स्ट-टू-स्पीच से बेहतर है?

यह बेहतर है जब सटीक प्रदर्शन पहले से मौजूद हो। टेक्स्ट-टू-स्पीच तब तेज़ होती है जब आपके पास केवल एक स्क्रिप्ट होती है और आप पूर्व निर्धारित आवाज़ चुनने में सहज होते हैं।

मुझे किस ऑडियो प्रारूप का उपयोग करना चाहिए?

एक साफ़ MP3 या WAV एक व्यावहारिक विकल्प है। अनावश्यक रूप से बड़ी फ़ाइल का उपयोग करने की तुलना में ऑडियो स्पष्टता और सुसंगत स्तर अधिक मायने रखता है।

क्या उपकरण मेरे विरामों को बदल देगा?

परिणाम अपलोड की गई रिकॉर्डिंग का अनुसरण करता है, इसलिए यदि आप उन्हें क्लिप में नहीं चाहते हैं तो पीढ़ी से पहले लंबे अंतराल या अवांछित सांसों को संपादित करें।

अपना स्वयं का संस्करण बनाएं

पहले एक छोटी वॉयस क्लिप को अंतिम रूप दें, फिर उसे स्पष्ट पोर्ट्रेट के साथ Audio to Talking Photo पर अपलोड करें।

Audio to Talking Photo

Related