
التركيبة التي أنصح بها لمشروعك
| المكوّن | الإصدار المقترح | الحالة |
|---|---|---|
| Python | 3.11.9 | ✅ |
| venv | مع Python 3.11 | ✅ |
| pip | أحدث إصدار | ✅ |
| PyTorch | 2.6.0 CPU | ✅ |
| TorchAudio | 2.6.0 | ✅ |
| TorchCodec | 0.2.x | ✅ متوافق مع PyTorch 2.6 |
| Coqui TTS | 0.27.5 | ✅ |
| XTTS v2 | ضمن Coqui TTS | ✅ |
| FastAPI | 0.115.x | ✅ |
| Uvicorn | 0.34.x | ✅ |
| FFmpeg | 6.x أو 7.x Shared | ⚠️ ضروري |
| imageio-ffmpeg | 0.6.x | ✅ |
| NumPy | 1.26.4 | ✅ |
| SciPy | 1.13.x | ✅ |
| librosa | 0.10.x | ✅ |
| soundfile | 0.12.x | ✅ |
| pydub | 0.25.1 | ✅ |
| python-multipart | 0.0.20 | ✅ |
| Pydantic | 2.x | ✅ |
Voice Hayef Clone رفع اي صوت وكتابه نص وينطق باي صوت النسخه الاولي
قبل التثبيت بحجم
204 KB
بعد التثبيت بحجم
5.99 GB
CPU مثل إعداد مشروعك الحالي (CUDA available: False)، فالمدة تختلف حسب طول التسجيل والنص.
بشكل تقريبي:
- 🎙️ أول تشغيل: قد يستغرق 1–5 دقائق بسبب تحميل نموذج XTTS.
- 🔊 بعد تحميل النموذج: نص قصير (10–20 كلمة) قد يستغرق تقريبًا 20–90 ثانية.
- 📝 نص أطول: قد يصل إلى دقيقتين أو أكثر.
- 💻 إذا كان الجهاز قويًا أو لديك GPU مناسب، يمكن أن يكون أسرع بكثير.
المهم: إذا بقيت عبارة «جاري توليد الصوت... يرجى الانتظار» أكثر من 5–10 دقائق بدون أي نتيجة، فغالبًا هناك مشكلة وليست مجرد بطء
امر التثبيت لاول مره :
setup.bat
وبعدها اكمال الخطئ
fix_ffmpeg.bat
وبعدها اكمال الخطي
fix_transformers.bat
عند التجربه مهم المتابع ل start
أما السؤال الظاهر:
إذا كنت تستخدم المشروع للاستخدام غير التجاري وتوافق على شروط CPML، اكتب:
ثم Enter.
إذا كان الاستخدام تجاريًا، فلا تختر y باعتبارها موافقة على الترخيص غير التجاري؛ تحتاج إلى الترخيص التجاري المناسب من Coqui
إذا عندك مقطع فيه صوت الشخص فقط بدون موسيقى أو مؤثرات فهذا هو الأفضل كمرجع.
ارفعه بهذه الأولوية:
- WAV — الأفضل.
- FLAC — ممتاز أيضًا.
- MP3 — يعمل، لكن WAV أفضل للجودة.
- M4A/OGG — ممكن، لكن لا أفضله إذا تستطيع تحويله إلى WAV.
المواصفات التي أنصح بها
والمدة الأفضل كبداية:
ويكون الصوت واضحًا ومستمرًا، وليس مقطعًا فيه كلام قليل جدًا أو فواصل طويلة.
بالنسبة لمشروعك
ضع الملف مثلًا:
لكن لا تحتاج أن تضعه داخل models.
وإذا كان عندك عدة مقاطع لنفس الشخص، احتفظ بها كلها:
لكن حاليًا بما أن مشروعك يستخدم ملفًا واحدًا، ابدأ بملف WAV واحد نظيف. لا نغيّر الكود قبل أن نختبره بهذا المرجع.
مهم: إذا كان الصوت لشخص حقيقي، استخدمه فقط إذا كان لديك الإذن اللازم لاستخدام صوته واستنساخه
حمل الملف واختار ما يناسبك :) هايف معكم اصوات
ارفع اي مقطع صوت صافي او اغاني او اي شي لرفع مهم واجباري
واكتب بالخانه الثاني مو شرط الاوله اختياري
في كل عمل عندك ملفين نظفهم وهم voices و outputs
اخيرا
نسخة كاملة من Server\voice_clone.py مصممة على وضعك الحالي:
- لا تستخدم
spacy. - لا تستخدم
enable_text_splitting=True. - تقبل الشعر والأسطر وعلامات الترقيم.
- النص الطويل يُقسّم داخليًا إلى مقاطع، ثم يُجمع في WAV واحد.
- تستخدم
voices\reference_01.wavو02و03. - تحافظ على النص العربي بدون تطبيع مضر بالنطق.
- تحافظ على الـ conditioning نفسه لكل المقاطع حتى لا تتغير النبرة بين مقطع وآخر.
- لا تحذف ملفات
voices\reference_01.wavالأصلية. - تعمل CPU.
- تستخدم FFmpeg الموجود داخل المشروع.
- لا تحتاج تثبيت أي مكتبة جديدة بسبب تقسيم النص.
نقطة مهمة جدًا
spacy ولا spacy[ja].وعند إدخال نصك مثل:
سيتم تقسيمه داخليًا، ثم إخراج ملف MP3 واحد من الـserver.py الموجود عندك.
والأهم: لا أنصح بتغيير الكلمات الخليجية أو تحويل أ/إ/آ إلى ا؛ النسخة السابقة كانت تفعل ذلك وقد تفسد نطق الشعر. هذه النسخة تترك النص الذي تكتبه كما هو تقريبًا، مع تنظيف المسافات فقط.
أما المحافظة على النبرة الخليجية، فالعامل الأكبر هنا هو جودة reference_01/02/03.wav. إذا كانت الثلاثة لنفس المتحدث وبها كلام خليجي واضح ونظيف، فالـXTTS سيأخذ منها الـconditioning نفسه لكل مقاطع النص
- ✅ Python 3.11.9
- ✅ PyTorch 2.8 CPU
- ✅ TorchAudio 2.8 CPU
- ✅ TorchCodec 0.7.0
- ✅ FFmpeg 7.1.1 Shared ويعمل
- ✅ Coqui TTS 0.27.5
- ✅ Transformers تم إصلاحه
- ✅ XTTS v2 يعمل
- ✅
voice_clone.pyيعمل - ✅ FastAPI يعمل
- ✅ الواجهة تعمل على 7860
- ✅
index.htmlوCSS وJavaScript يتم تحميلها - ✅ رفع الصوت يصل إلى السيرفر
- ✅ توليد الصوت يعمل
لكن أقول إن المشروع مكتمل كـ نسخة تشغيلية، وليس بالضرورة أن جودة استنساخ الصوت وصلت للمستوى الاحترافي الذي تريده.
المرحلة المتبقية اختيارية: تحسين النطق العربي + النبرة الخليجية + جودة المرجع + سرعة CPU.




ليست هناك تعليقات: