ट्यूटोरियल

एक तस्वीर से AI अवतार का लिप सिंक कैसे बनाएं

FreeLipSync TeamFreeLipSync Team|5 min read
एक प्रीमियम स्टूडियो में FreeLipSync ब्रांड प्रस्तोता को एक-छवि AI अवतार ट्यूटोरियल के स्रोत के रूप में उपयोग किया जाता है

एक छवि से एआई अवतार लिप सिंक बनाने के लिए, AI Talking Photo Generator पर एक स्पष्ट सामने वाला चित्र अपलोड करें, एक छोटी स्क्रिप्ट टाइप करें, एक आवाज चुनें और उत्पन्न करें। एक वाक्य और एक अबाधित मुख से प्रारंभ करें; नीचे दिया गया कच्चा परिणाम प्रदर्शित प्रस्तुतकर्ता छवि और 10-सेकंड की स्क्रिप्ट से बनाया गया था।

जिसकी आपको जरूरत है

  • स्रोत छवि: यह उदाहरण स्वीकृत FreeLipSync ब्रांड प्रस्तोता का उपयोग करता है: एक प्रीमियम स्टूडियो में एक काल्पनिक द्विजातीय काली और सफेद महिला, एक सूक्ष्म दीवार लोगो और ब्रांड पिन के साथ। एक लैंडस्केप स्रोत एक ट्यूटोरियल या लैंडिंग-पेज प्रस्तुतकर्ता के लिए अच्छा काम करता है क्योंकि यह पहले से ही विषय के चारों ओर उपयोग करने योग्य स्थान छोड़ देता है।
  • इस उदाहरण में प्रयुक्त इनपुट ऑडियो: पंक्ति जानबूझकर छोटी और संवादात्मक है। टेक्स्ट-टू-स्पीच ड्राइविंग ऑडियो बनाता है, इसलिए विराम चिह्न उपयोगी ठहराव को नियंत्रित करता है। पहले परीक्षण के लिए, लंबे पैराग्राफ, संक्षिप्ताक्षरों से बचें जिन्हें अप्रत्याशित रूप से उच्चारित किया जा सकता है, या ऐसी आवाज शैली से बचें जो चित्र के साथ टकराव करती हो।
  • औजार: AI Talking Photo Generator

उस पोर्ट्रेट का उपयोग करें जो आपके पास है या जिसे एनिमेट करने की अनुमति आपके पास है। यदि अवतार काल्पनिक है या एआई-जनरेटेड है, तो इसका खुलासा करें जहां कोई दर्शक इसे वास्तविक प्रवक्ता समझने की गलती कर सकता है।

स्रोत छवि और इनपुट

एक प्रीमियम स्टूडियो में FreeLipSync ब्रांड प्रस्तोता को एक-छवि AI अवतार ट्यूटोरियल के स्रोत के रूप में उपयोग किया जाता है

इस उदाहरण में प्रयुक्त इनपुट ऑडियो

यह इस स्थानीयकृत डेमो ऑडियो में इस्तेमाल की गई सटीक स्क्रिप्ट है:

एक साफ़ फोटो ही काफ़ी है। छोटा सा स्क्रिप्ट जोड़ें, आवाज़ चुनें, और FreeLipSync बिना नई शूटिंग के तस्वीर को स्वाभाविक बोलने वाले एआई अवतार में बदल देता है।

कच्चा परिणाम

यह संपूर्ण कच्चा परिणाम है, न कि प्रस्तुतकर्ता के नेतृत्व में किया गया पूर्वाभ्यास और न ही हाथ से किया गया संपादन। यह आपको एक लंबा संस्करण बनाने का निर्णय लेने से पहले एक छवि और सटीक ऑडियो द्वारा उत्पन्न होंठों की गति का आकलन करने देता है।

समर्पित वीडियो दृश्य पृष्ठ खोलें

चरण-दर-चरण कार्यप्रवाह

  1. एक स्पष्ट स्रोत छवि तैयार करें — एक सामने की ओर वाली छवि का उपयोग करें जिसमें मुंह दिखाई दे रहा हो, रोशनी भी समान हो और कोई हाथ, माइक्रोफोन या भारी छाया होंठों को न ढक रही हो।
  2. मिलान करने वाले FreeLipSync टूल को खोलें — इस वर्कफ़्लो के लिए लिंक किया गया टूल खोलें. पुष्टि करें कि इसका इनपुट मोड आपके स्रोत से मेल खाता है: पाठ, अपलोड किया गया भाषण, या गीत ऑडियो।
  3. स्क्रिप्ट या ऑडियो इनपुट जोड़ें — एक संक्षिप्त स्वच्छ इनपुट जोड़ें. पहले परीक्षण को सरल रखें ताकि यह बताना आसान हो कि छवि और ऑडियो एक अच्छा मेल हैं या नहीं।
  4. लिप-सिंक परिणाम उत्पन्न करें — एक साथ कई चर बदले बिना एक कच्चा परिणाम उत्पन्न करें। एक नियंत्रित पहला पास समस्या निवारण को बहुत तेज़ बनाता है।
  5. प्रकाशन से पहले पूर्ण परिणाम की समीक्षा करें — आरंभ से अंत तक ध्वनि के साथ देखें. मुंह की दृश्यता, समय, उच्चारण और क्या क्लिप स्रोत का ईमानदारी से प्रतिनिधित्व करता है, इसकी जांच करें।

यह सेटअप क्यों काम करता है

एक स्पष्ट माध्यम शॉट मॉडल को स्थिर चेहरे का विवरण देता है जबकि छोटा वाक्य कठिन बदलावों को सीमित करता है। विषय कैमरे का सामना करता है, होंठ अवरुद्ध नहीं होते हैं, और स्टूडियो पृष्ठभूमि चेहरे से प्रतिस्पर्धा नहीं करती है।

गुणवत्ता जांच सूची

  • दोनों आँखें और पूरा मुँह दृश्यमान रखें; पीढ़ी दर पीढ़ी ही फसल।
  • स्क्रिप्ट को बोली जाने वाली भाषा के रूप में लिखें और प्राकृतिक श्वास बिंदुओं के लिए विराम चिह्न का उपयोग करें।
  • लंबी प्रस्तुति पर समय बिताने से पहले एक छोटे वाक्य का परीक्षण करें।

बचने योग्य सामान्य गलतियाँ

  • उस पोर्ट्रेट का उपयोग करें जो आपके पास है या जिसे एनिमेट करने की अनुमति आपके पास है। यदि अवतार काल्पनिक है या एआई-जनरेटेड है, तो इसका खुलासा करें जहां कोई दर्शक इसे वास्तविक प्रवक्ता समझने की गलती कर सकता है।
  • किसी लंबी स्क्रिप्ट या गाने से शुरुआत न करें। एक छोटा सा पहला पास आपको तेज़, अधिक उपयोगी गुणवत्ता वाला सिग्नल देता है।
  • जब तक आपके पास आवश्यक अनुमति या लाइसेंस न हो, कोई चेहरा, चरित्र, रिकॉर्डिंग या गीत प्रकाशित न करें।

प्रश्न लोग पूछते हैं

क्या एक तस्वीर सचमुच एक बोलता हुआ अवतार बना सकती है?

हाँ। इस वर्कफ़्लो के लिए एक स्पष्ट एकल चित्र पर्याप्त है; ऑडियो मुंह की गतिविधि को संचालित करता है जबकि छवि पहचान और फ़्रेमिंग प्रदान करती है।

क्या स्रोत पेशेवर हेडशॉट होना चाहिए?

नहीं, एक फ़ोन फ़ोटो तभी काम कर सकती है जब चेहरा तेज़ हो, सामने की ओर हो, समान रोशनी वाला हो, और बालों, हाथों या माइक्रोफ़ोन से ढका न हो।

क्या मुझे टेक्स्ट या अपलोड किए गए ऑडियो का उपयोग करना चाहिए?

जब आप तेज़ टेक्स्ट-टू-स्पीच चाहते हैं तो टेक्स्ट का उपयोग करें। जब आपके पास पहले से ही अंतिम प्रदर्शन, गति, या ध्वनि रिकॉर्डिंग हो तो Audio to Talking Photo का उपयोग करें।

अपना स्वयं का संस्करण बनाएं

AI Talking Photo Generator खोलें, ऊपर दी गई चेकलिस्ट का पुन: उपयोग करें, और स्क्रिप्ट का विस्तार करने से पहले एक छोटी प्रूफ़ क्लिप बनाएं।

AI Talking Photo Generator

Related