अपने वीडियो की बोली को तैयार रिकॉर्डिंग से बदलने के लिए मूल वीडियो और नया ऑडियो Audio to Video Lip Sync पर अपलोड करें। FreeLipSync फिल्माए गए प्रदर्शन के उपयुक्त हिस्सों को नई आवाज़ के अनुसार मिलाता है। इसलिए कुछ सेकंड का सोर्स भी लंबा, स्वाभाविक और वास्तविक दिखने वाला बोलता वीडियो बना सकता है। अगर मूल वीडियो पहले से लंबा है, तो उसके हावभाव और चेहरे के भाव बनाए रखते हुए उसकी बोली बदली जा सकती है।
इस उदाहरण में 5.06 सेकंड का सोर्स वीडियो, 39.42 सेकंड का ऑडियो और 39.44 सेकंड का तैयार वीडियो है।
अपलोड किए गए ऑडियो से बोली क्यों बदलें?
एक बार शूट करें, कई संदेश बनाएँ
नियमित उत्पाद अपडेट, पाठ की शुरुआत या घोषणाओं के लिए हर बार कैमरा, रोशनी और स्थान तैयार करने में समय और पैसा लगता है। सामान्य, स्वाभाविक हावभाव वाला छोटा क्लिप सुरक्षित रखें और हर नए संदेश के लिए केवल आवाज़ रिकॉर्ड करें। इससे दोबारा कैमरे पर बोलने की जरूरत घटती है। वीडियो में वास्तविक रूप से शूट की गई गति और चेहरे के भाव रहते हैं, इसलिए छोटा सोर्स भी लंबी प्रस्तुति को विश्वसनीय बना सकता है।
एक संदेश के कई संस्करण बनाएँ
अलग दर्शकों, अभियानों या भाषाओं के लिए वही बात नए शब्दों में कहनी पड़ सकती है। हर संस्करण की स्क्रिप्ट और रिकॉर्डिंग जाँचें, फिर एक ही सोर्स वीडियो के साथ इस्तेमाल करें। लिप सिंक तैयार आवाज़ से दिखने वाली बोली मिलाता है; अनुवाद अपने आप नहीं करता।
पहले से लंबे वीडियो की बोली अपडेट करें
रिकॉर्ड किया हुआ पाठ या प्रस्तुति भी सोर्स बन सकती है। जिस हिस्से को बदलना है, उसे नई रिकॉर्डिंग के साथ अपलोड करें। मूल हरकतें और चेहरे के भाव दृश्य का आधार बने रहते हैं। इस उपयोग को यहाँ केवल शब्दों में समझाया गया है; अलग लंबा वीडियो उदाहरण नहीं जोड़ा गया। यदि व्यक्ति चार्ट की ओर इशारा करता है या कोई वस्तु उठाता है, तो नई बोली उन दृश्यों से मेल खानी चाहिए। बड़े संपादित वीडियो का सिर्फ एक भाग बदलना हो तो पहले वही भाग काटें और बाद में वापस जोड़ें।
दोबारा इस्तेमाल करने लायक सोर्स चुनें
अपना वीडियो या ऐसा फुटेज लें जिसे बदलने की अनुमति हो; नया शूट आवश्यक नहीं है। नीचे का बाहरी क्लिप 5.06 सेकंड का है और परिणाम के लिए मूल हरकतें तथा भाव देता है:
सोर्स की अवधि ऑडियो जितनी होना जरूरी नहीं है, और मुँह का बिल्कुल सामने से स्पष्ट दिखना भी मुख्य शर्त नहीं है। अलग-अलग वाक्यों के साथ सही लगने वाली सामान्य हरकतें और लचीले भाव चुनें। वीडियो इनपुट में मौजूदा गति और भाव बने रहते हैं और नई आवाज़ से होंठ मिलते हैं। इसके विपरीत, Max इमेज मॉडल तस्वीर से गति और भाव नए सिरे से बनाता है, इसलिए अधिक समय लेता है। प्रकाशित करने से पहले फुटेज और व्यक्ति की छवि इस्तेमाल करने की अनुमति जाँचें।
नया ऑडियो तैयार करें
अंतिम रिकॉर्डिंग पूरी सुनकर शब्द, उच्चारण और बोलने की गति जाँचें। यहाँ इस्तेमाल अंग्रेज़ी ऑडियो 39.42 सेकंड का है:
39 सेकंड का नया ऑडियो
यदि रिकॉर्डिंग के बजाय सिर्फ नई स्क्रिप्ट है, तो टेक्स्ट से बोलता वीडियो बदलने वाला ट्यूटोरियल देखें। दूसरी भाषा के लिए अनुवाद और आवाज़ पहले सत्यापित करें।
वीडियो और ऑडियो अपलोड करें
- Audio to Video Lip Sync खोलें।
- जिस वीडियो की हरकतें और भाव रखने हैं, उसे अपलोड करें।
- Upload Audio चुनें, तैयार रिकॉर्डिंग अपलोड करें और दोनों फाइलें जाँचें।
- दिख रहे जनरेशन विकल्प जाँचकर प्रक्रिया शुरू करें।
यह स्क्रीनशॉट वास्तविक इनपुट दिखाता है: लगभग पाँच सेकंड का सोर्स और 39 सेकंड का ऑडियो। स्क्रीनशॉट प्रक्रिया के दौरान लिया गया था; तैयार परिणाम नीचे है।

परिणाम की दोनों इनपुट से तुलना करें
तैयार वीडियो 39.44 सेकंड का है, यानी ऑडियो के लगभग बराबर और सोर्स से करीब आठ गुना लंबा:
परिणाम के अलग प्ले पेज पर जाएँ
सोर्स, रिकॉर्डिंग और परिणाम की तुलना करें। शरीर की गति और चेहरे के भाव मूल प्रदर्शन जैसे स्वाभाविक रहें, जबकि आवाज़ और होंठ नए ऑडियो का अनुसरण करें। लंबे संदेशों के लिए सोर्स की लंबाई से ज्यादा उसका अलग-अलग स्क्रिप्ट के साथ स्वाभाविक लगना अहम है।
अक्सर पूछे जाने वाले प्रश्न
क्या अपलोड किया ऑडियो सोर्स वीडियो से लंबा हो सकता है?
हाँ। यहाँ 5.06 सेकंड का सोर्स और 39.42 सेकंड का ऑडियो मिलकर 39.44 सेकंड का वीडियो बनाते हैं। FreeLipSync मूल प्रदर्शन के उपयुक्त हिस्से चुनता है।
क्या पहले से लंबे वीडियो की बोली बदली जा सकती है?
हाँ। लंबा वीडियो और नई रिकॉर्डिंग अपलोड करें। यदि संपादित वीडियो के एक भाग को ही बदलना है, तो उस हिस्से को अलग प्रोसेस कर वापस जोड़ें।
छोटा सोर्स बार-बार इस्तेमाल करने लायक कैसे बनेगा?
ऐसी स्वाभाविक हरकतें और भाव चुनें जो कई संदेशों के साथ ठीक लगें। लंबाई या बिल्कुल सामने दिखता मुँह मुख्य बात नहीं; किसी एक वाक्य से बँधी हरकतों से बचें।
यह Max इमेज मॉडल से कैसे अलग है?
वीडियो इनपुट पहले से फिल्माई गई गति और भाव रखता है और नई आवाज़ से होंठ मिलाता है। Max तस्वीर से गति और भाव नए सिरे से बनाता है, इसलिए अधिक समय लगता है।
अंतिम अपडेट:



