اخر المواضيع

آخر الأخبار
إختر لونك المفضل

عرض المحتوي

بحث

الأحد، 23 أغسطس 2026

رفع اي مقطع صوت وكتابه نص ويتكلم بنبره الصوت اللى رفعته Voice Hayef Clone الاصدار الاول

السفراني | أغسطس 23, 2026 |
السلام عليكم

التركيبة التي أنصح بها لمشروعك

المكوّنالإصدار المقترحالحالة
Python3.11.9
venvمع Python 3.11
pipأحدث إصدار
PyTorch2.6.0 CPU
TorchAudio2.6.0
TorchCodec0.2.x✅ متوافق مع PyTorch 2.6
Coqui TTS0.27.5
XTTS v2ضمن Coqui TTS
FastAPI0.115.x
Uvicorn0.34.x
FFmpeg6.x أو 7.x Shared⚠️ ضروري
imageio-ffmpeg0.6.x
NumPy1.26.4
SciPy1.13.x
librosa0.10.x
soundfile0.12.x
pydub0.25.1
python-multipart0.0.20
Pydantic2.x

 

Voice Hayef Clone رفع اي صوت وكتابه نص وينطق باي صوت النسخه الاولي

قبل التثبيت بحجم

204 KB

بعد التثبيت بحجم

5.99 GB

CPU مثل إعداد مشروعك الحالي (CUDA available: False)، فالمدة تختلف حسب طول التسجيل والنص.

بشكل تقريبي:

  • 🎙️ أول تشغيل: قد يستغرق 1–5 دقائق بسبب تحميل نموذج XTTS.
  • 🔊 بعد تحميل النموذج: نص قصير (10–20 كلمة) قد يستغرق تقريبًا 20–90 ثانية.
  • 📝 نص أطول: قد يصل إلى دقيقتين أو أكثر.
  • 💻 إذا كان الجهاز قويًا أو لديك GPU مناسب، يمكن أن يكون أسرع بكثير.

المهم: إذا بقيت عبارة «جاري توليد الصوت... يرجى الانتظار» أكثر من 5–10 دقائق بدون أي نتيجة، فغالبًا هناك مشكلة وليست مجرد بطء

امر التثبيت لاول مره :

setup.bat

وبعدها اكمال الخطئ

fix_ffmpeg.bat

وبعدها اكمال الخطي

fix_transformers.bat

 

عند التجربه مهم المتابع ل start

أما السؤال الظاهر:

I have purchased a commercial license...
Otherwise, I agree to the terms of the non-commercial CPML: [y/n]

إذا كنت تستخدم المشروع للاستخدام غير التجاري وتوافق على شروط CPML، اكتب:

y

ثم Enter.

إذا كان الاستخدام تجاريًا، فلا تختر y باعتبارها موافقة على الترخيص غير التجاري؛ تحتاج إلى الترخيص التجاري المناسب من Coqui

إذا عندك مقطع فيه صوت الشخص فقط بدون موسيقى أو مؤثرات فهذا هو الأفضل كمرجع.

ارفعه بهذه الأولوية:

  1. WAV — الأفضل.
  2. FLAC — ممتاز أيضًا.
  3. MP3 — يعمل، لكن WAV أفضل للجودة.
  4. M4A/OGG — ممكن، لكن لا أفضله إذا تستطيع تحويله إلى WAV.

المواصفات التي أنصح بها

WAV
Mono
16-bit PCM
44.1 kHz أو 48 kHz
بدون موسيقى
بدون صدى قوي
بدون ضوضاء

والمدة الأفضل كبداية:

10–30 ثانية

ويكون الصوت واضحًا ومستمرًا، وليس مقطعًا فيه كلام قليل جدًا أو فواصل طويلة.

بالنسبة لمشروعك

ضع الملف مثلًا:

D:\Voice-Hayef-Clone\voices\reference.wav

لكن لا تحتاج أن تضعه داخل models.

وإذا كان عندك عدة مقاطع لنفس الشخص، احتفظ بها كلها:

voices\
├── reference1.wav
├── reference2.wav
└── reference3.wav

لكن حاليًا بما أن مشروعك يستخدم ملفًا واحدًا، ابدأ بملف WAV واحد نظيف. لا نغيّر الكود قبل أن نختبره بهذا المرجع.

مهم: إذا كان الصوت لشخص حقيقي، استخدمه فقط إذا كان لديك الإذن اللازم لاستخدام صوته واستنساخه

حمل الملف واختار ما يناسبك :) هايف معكم اصوات

النسبه لصوت لمشروه افضل
حوالي 7.86 ثانية
اختر اي صوت
بعد التنظيف قسّمه إلى 3 أجزاء
أفضل خيار بسيط:
Notevibes Audio Splitter
اختر 3 parts، وسيقسم الملف إلى ثلاثة أجزاء. المعالجة تتم داخل المتصفح حسب الموقع، ولا يحتاج رفع الملف إلى خادم 

ارفع اي مقطع صوت صافي او اغاني او اي شي لرفع مهم واجباري

واكتب بالخانه الثاني مو شرط الاوله اختياري

في كل عمل عندك ملفين نظفهم وهم voices و outputs

اخيرا

نسخة كاملة من Server\voice_clone.py مصممة على وضعك الحالي:

  • لا تستخدم spacy.
  • لا تستخدم enable_text_splitting=True.
  • تقبل الشعر والأسطر وعلامات الترقيم.
  • النص الطويل يُقسّم داخليًا إلى مقاطع، ثم يُجمع في WAV واحد.
  • تستخدم voices\reference_01.wav و02 و03.
  • تحافظ على النص العربي بدون تطبيع مضر بالنطق.
  • تحافظ على الـ conditioning نفسه لكل المقاطع حتى لا تتغير النبرة بين مقطع وآخر.
  • لا تحذف ملفات voices\reference_01.wav الأصلية.
  • تعمل CPU.
  • تستخدم FFmpeg الموجود داخل المشروع.
  • لا تحتاج تثبيت أي مكتبة جديدة بسبب تقسيم النص.

نقطة مهمة جدًا

لا تثبت spacy ولا spacy[ja].
هذه النسخة لا تستخدمه أصلًا.

وعند إدخال نصك مثل:

هبت رياح الصيف وتغير الجو
وأنا وليفي مايداني سمومه
هو يحسب إن شمس الضحى سيدي ضو
ريّان عوده زايدٍ في النعومة
فقلت أنا والله ياسيدي لو
تسكن قصورٍ شيدوها بروما

سيتم تقسيمه داخليًا، ثم إخراج ملف MP3 واحد من الـserver.py الموجود عندك.

والأهم: لا أنصح بتغيير الكلمات الخليجية أو تحويل أ/إ/آ إلى ا؛ النسخة السابقة كانت تفعل ذلك وقد تفسد نطق الشعر. هذه النسخة تترك النص الذي تكتبه كما هو تقريبًا، مع تنظيف المسافات فقط.

أما المحافظة على النبرة الخليجية، فالعامل الأكبر هنا هو جودة reference_01/02/03.wav. إذا كانت الثلاثة لنفس المتحدث وبها كلام خليجي واضح ونظيف، فالـXTTS سيأخذ منها الـconditioning نفسه لكل مقاطع النص

  • ✅ Python 3.11.9
  • ✅ PyTorch 2.8 CPU
  • ✅ TorchAudio 2.8 CPU
  • ✅ TorchCodec 0.7.0
  • ✅ FFmpeg 7.1.1 Shared ويعمل
  • ✅ Coqui TTS 0.27.5
  • ✅ Transformers تم إصلاحه
  • ✅ XTTS v2 يعمل
  • ✅ voice_clone.py يعمل
  • ✅ FastAPI يعمل
  • ✅ الواجهة تعمل على 7860
  • ✅ index.html وCSS وJavaScript يتم تحميلها
  • ✅ رفع الصوت يصل إلى السيرفر
  • ✅ توليد الصوت يعمل

لكن أقول إن المشروع مكتمل كـ نسخة تشغيلية، وليس بالضرورة أن جودة استنساخ الصوت وصلت للمستوى الاحترافي الذي تريده.

المرحلة المتبقية اختيارية: تحسين النطق العربي + النبرة الخليجية + جودة المرجع + سرعة CPU.

نحذف الملفات المؤقتة فقط عند الخروج، ونحافظ دائمًا على المراجع الثلاثة:

voices/
├── reference_01.wav ← لا يُحذف
├── reference_02.wav ← لا يُحذف
└── reference_03.wav ← لا يُحذف

أما الملفات التي ينشئها التطبيق مثل الأصوات المرفوعة والناتجة في outputs فيمكن تنظيفها.

إذا تريد أمرًا بسيطًا داخل voice_clone.py، أضف في آخر الملف:

import atexit

 
def cleanup_project_files():
# تنظيف outputs
if OUTPUTS_DIR.exists():
for file in OUTPUTS_DIR.iterdir():
try:
if file.is_file():
file.unlink()
except Exception:
pass

 
# تنظيف voices مع الحفاظ على المراجع الثلاثة
protected = {
"reference_01.wav",
"reference_02.wav",
"reference_03.wav",
}

 
if VOICES_DIR.exists():
for file in VOICES_DIR.iterdir():
try:
if file.is_file() and file.name.lower() not in protected:
file.unlink()
except Exception:
pass

 
# تنظيف الملفات المؤقتة
if TEMP_DIR.exists():
for file in TEMP_DIR.iterdir():
try:
if file.is_file():
file.unlink()
except Exception:
pass

 
atexit.register(cleanup_project_files)

النتيجة

عند إغلاق البرنامج بشكل طبيعي:

voices/
├── reference_01.wav
├── reference_02.wav
└── reference_03.wav

تبقى ثابتة.

بينما:

outputs/

يتم تنظيف الملفات التي أنشأها التطبيق.

و:

temp/

يتم تنظيف الملفات المؤقتة.

مهم: هذا يعمل عند إغلاق Python بشكل طبيعي، وليس مضمونًا إذا أُغلقت العملية بالقوة من Task Manager.

*** اذا حبيت تجربه voice_clone101

author

ليست هناك تعليقات:

اضف تعليقك هنا