यह Text to Video Lip Sync उदाहरण एक natural talking clip से शुरू होता है। अंतिम line को audio में देने के बजाय, हम छोटी sample से voice clone करते हैं और text से line बदलते हैं।
Source clip
यह tutorial में इस्तेमाल source video है।
Source video की आवश्यकताएँ
- Natural speaking clip सबसे अच्छा है और उसमें अंतिम line होना जरूरी नहीं।
- लगभग 5 सेकंड से कुछ मिनट तक ठीक है।
- अधिकांश shot में चेहरा दिखना चाहिए।
- छोटी और विश्वसनीय movement अच्छी है।
- बहुत बड़े gestures, अचानक turns या action से बचें।
यदि खास तौर पर यह clip रिकॉर्ड कर रहे हैं तो उसे सरल और natural रखें। “एक, दो, तीन” कहना पर्याप्त है; camera पर अंतिम script याद करने की जरूरत नहीं।
Voice reference
बोलने की शैली clone करने के लिए यह छोटी reference इस्तेमाल हुई:
Voice reference input
Replacement script
Demo में वास्तव में इस्तेमाल अंग्रेज़ी script नीचे है; result से सही मेल के लिए इसे अनुवाद नहीं किया गया:
That's it for today! Isn't this incredible? It's free, it's fast, it's u* — and you can even generate lip sync videos up to 60 minutes long.
यह तरीका उपयोगी है जब:
- नई audio recording के बिना line बदलनी हो।
- एक वाक्य जल्दी localize या ठीक करना हो।
- नई speech में चुनी हुई voice identity रखनी हो।
Generated result
यह result source clip, voice reference और नए script से बना है:
यह tutorial क्या दिखाता है
- एक natural source clip को पूरी नई line के लिए फिर इस्तेमाल किया जा सकता है।
- छोटी voice reference identity तय करने के लिए पर्याप्त है।
- Source movement शांत और natural हो तो rewrite बेहतर होता है।
यह workflow कैसे बनाएँ
- Text to Video Lip Sync खोलें।
- एक साफ़ चेहरे वाला natural talking video अपलोड करें।
- Clone के लिए छोटी voice reference अपलोड करें।
- नया script paste करें।
- Generate करके जाँचें कि नई line मूल shot में natural लगती है।



