kawter/tpupload
0
π¬ Automated Video Dubbing & Translation Pipeline
Projet TP 2026 β Pipeline de doublage automatique open-source, sans aucune API commerciale.
ποΈ Architecture du Pipeline
VidΓ©o uploadΓ©e
β
βΌ
βββββββββββββββββββββββββββββββββββββββββββββββββββ
β TASK 1 β Extraction & Transcription β
β β’ ffmpeg β audio WAV mono 16kHz β
β β’ WhisperX (medium) β ASR β
β β’ wav2vec2 β Alignement forcΓ© (timestamps Β±50ms)β
β Output: segments [{start, end, text}] β
βββββββββββββββββββββββ¬ββββββββββββββββββββββββββββ
β
βΌ
βββββββββββββββββββββββββββββββββββββββββββββββββββ
β TASK 2 β Traduction LLM Local β
β β’ Qwen2.5-1.5B-Instruct (< 2B params) β
β β’ Traduction segment par segment β
β β’ Anti-hallucination: parse regex + prompt β
β Output: SRT traduit (timestamps intacts) β
βββββββββββββββββββββββ¬ββββββββββββββββββββββββββββ
β
βΌ
βββββββββββββββββββββββββββββββββββββββββββββββββββ
β TASK 3 β Text-to-Speech HuggingFace β
β β’ facebook/mms-tts (1100+ langues) β
β β’ Time-stretch (librosa PSOLA) si dΓ©passement β
β β’ BONUS: voice cloning via suno/bark β
β Output: piste audio doublΓ©e (WAV) β
βββββββββββββββββββββββ¬ββββββββββββββββββββββββββββ
β
βΌ
βββββββββββββββββββββββββββββββββββββββββββββββββββ
β TASK 4 β Mixage & IntΓ©gration VidΓ©o β
β β’ Audio Ducking: original 10% / TTS 90% β
β β’ Fade in/out 80ms pour Γ©viter les clics β
β β’ Gravure SRT avec ffmpeg (subtitles filter) β
β Output: vidΓ©o finale MP4 β
βββββββββββββββββββββββββββββββββββββββββββββββββββπ€ ModΓ¨les UtilisΓ©s
β Aucune API commerciale β Tous les modΓ¨les sont open-weights
π Langues SupportΓ©es
French, Spanish, German, Arabic, Italian, Portuguese, Turkish
π Utilisation
- Uploadez votre vidΓ©o (MP4, AVI, MOV β max ~200MB)
- SΓ©lectionnez la langue cible
- Cliquez sur "Lancer le doublage"
- TΓ©lΓ©chargez la vidΓ©o doublΓ©e
π Choix d'IngΓ©nierie
- WhisperX plutΓ΄t que Whisper seul β timestamps prΓ©cis Γ Β±50ms via wav2vec2
- Qwen2.5-1.5B plutΓ΄t que TinyLlama β meilleure qualitΓ© de traduction multilingue Γ taille Γ©quivalente
- MMS-TTS plutΓ΄t que SpeechT5 β support natif de 1100+ langues sans fine-tuning
- Upload local plutΓ΄t qu'URL YouTube β Γ©vite les restrictions rΓ©seau dans l'environnement Docker HF Spaces
