اخر المواضيع

آخر الأخبار
إختر لونك المفضل

عرض المحتوي

بحث

‏إظهار الرسائل ذات التسميات الذكاء الاصطناعي AI. إظهار كافة الرسائل
‏إظهار الرسائل ذات التسميات الذكاء الاصطناعي AI. إظهار كافة الرسائل

الأحد، 23 أغسطس 2026

رفع اي مقطع صوت وكتابه نص ويتكلم بنبره الصوت اللى رفعته Voice Hayef Clone الاصدار الاول

التركيبة التي أنصح بها لمشروعك

المكوّنالإصدار المقترحالحالة
Python3.11.9
venvمع Python 3.11
pipأحدث إصدار
PyTorch2.6.0 CPU
TorchAudio2.6.0
TorchCodec0.2.x✅ متوافق مع PyTorch 2.6
Coqui TTS0.27.5
XTTS v2ضمن Coqui TTS
FastAPI0.115.x
Uvicorn0.34.x
FFmpeg6.x أو 7.x Shared⚠️ ضروري
imageio-ffmpeg0.6.x
NumPy1.26.4
SciPy1.13.x
librosa0.10.x
soundfile0.12.x
pydub0.25.1
python-multipart0.0.20
Pydantic2.x

 

Voice Hayef Clone رفع اي صوت وكتابه نص وينطق باي صوت النسخه الاولي

قبل التثبيت بحجم

204 KB

بعد التثبيت بحجم

5.99 GB

CPU مثل إعداد مشروعك الحالي (CUDA available: False)، فالمدة تختلف حسب طول التسجيل والنص.

بشكل تقريبي:

  • 🎙️ أول تشغيل: قد يستغرق 1–5 دقائق بسبب تحميل نموذج XTTS.
  • 🔊 بعد تحميل النموذج: نص قصير (10–20 كلمة) قد يستغرق تقريبًا 20–90 ثانية.
  • 📝 نص أطول: قد يصل إلى دقيقتين أو أكثر.
  • 💻 إذا كان الجهاز قويًا أو لديك GPU مناسب، يمكن أن يكون أسرع بكثير.

المهم: إذا بقيت عبارة «جاري توليد الصوت... يرجى الانتظار» أكثر من 5–10 دقائق بدون أي نتيجة، فغالبًا هناك مشكلة وليست مجرد بطء

امر التثبيت لاول مره :

setup.bat

وبعدها اكمال الخطئ

fix_ffmpeg.bat

وبعدها اكمال الخطي

fix_transformers.bat

 

عند التجربه مهم المتابع ل start

أما السؤال الظاهر:

I have purchased a commercial license...
Otherwise, I agree to the terms of the non-commercial CPML: [y/n]

إذا كنت تستخدم المشروع للاستخدام غير التجاري وتوافق على شروط CPML، اكتب:

y

ثم Enter.

إذا كان الاستخدام تجاريًا، فلا تختر y باعتبارها موافقة على الترخيص غير التجاري؛ تحتاج إلى الترخيص التجاري المناسب من Coqui

إذا عندك مقطع فيه صوت الشخص فقط بدون موسيقى أو مؤثرات فهذا هو الأفضل كمرجع.

ارفعه بهذه الأولوية:

  1. WAV — الأفضل.
  2. FLAC — ممتاز أيضًا.
  3. MP3 — يعمل، لكن WAV أفضل للجودة.
  4. M4A/OGG — ممكن، لكن لا أفضله إذا تستطيع تحويله إلى WAV.

المواصفات التي أنصح بها

WAV
Mono
16-bit PCM
44.1 kHz أو 48 kHz
بدون موسيقى
بدون صدى قوي
بدون ضوضاء

والمدة الأفضل كبداية:

10–30 ثانية

ويكون الصوت واضحًا ومستمرًا، وليس مقطعًا فيه كلام قليل جدًا أو فواصل طويلة.

بالنسبة لمشروعك

ضع الملف مثلًا:

D:\Voice-Hayef-Clone\voices\reference.wav

لكن لا تحتاج أن تضعه داخل models.

وإذا كان عندك عدة مقاطع لنفس الشخص، احتفظ بها كلها:

voices\
├── reference1.wav
├── reference2.wav
└── reference3.wav

لكن حاليًا بما أن مشروعك يستخدم ملفًا واحدًا، ابدأ بملف WAV واحد نظيف. لا نغيّر الكود قبل أن نختبره بهذا المرجع.

مهم: إذا كان الصوت لشخص حقيقي، استخدمه فقط إذا كان لديك الإذن اللازم لاستخدام صوته واستنساخه

حمل الملف واختار ما يناسبك :) هايف معكم اصوات

النسبه لصوت لمشروه افضل
حوالي 7.86 ثانية
اختر اي صوت
بعد التنظيف قسّمه إلى 3 أجزاء
أفضل خيار بسيط:
Notevibes Audio Splitter
اختر 3 parts، وسيقسم الملف إلى ثلاثة أجزاء. المعالجة تتم داخل المتصفح حسب الموقع، ولا يحتاج رفع الملف إلى خادم 

ارفع اي مقطع صوت صافي او اغاني او اي شي لرفع مهم واجباري

واكتب بالخانه الثاني مو شرط الاوله اختياري

في كل عمل عندك ملفين نظفهم وهم voices و outputs

اخيرا

نسخة كاملة من Server\voice_clone.py مصممة على وضعك الحالي:

  • لا تستخدم spacy.
  • لا تستخدم enable_text_splitting=True.
  • تقبل الشعر والأسطر وعلامات الترقيم.
  • النص الطويل يُقسّم داخليًا إلى مقاطع، ثم يُجمع في WAV واحد.
  • تستخدم voices\reference_01.wav و02 و03.
  • تحافظ على النص العربي بدون تطبيع مضر بالنطق.
  • تحافظ على الـ conditioning نفسه لكل المقاطع حتى لا تتغير النبرة بين مقطع وآخر.
  • لا تحذف ملفات voices\reference_01.wav الأصلية.
  • تعمل CPU.
  • تستخدم FFmpeg الموجود داخل المشروع.
  • لا تحتاج تثبيت أي مكتبة جديدة بسبب تقسيم النص.

نقطة مهمة جدًا

لا تثبت spacy ولا spacy[ja].
هذه النسخة لا تستخدمه أصلًا.

وعند إدخال نصك مثل:

هبت رياح الصيف وتغير الجو
وأنا وليفي مايداني سمومه
هو يحسب إن شمس الضحى سيدي ضو
ريّان عوده زايدٍ في النعومة
فقلت أنا والله ياسيدي لو
تسكن قصورٍ شيدوها بروما

سيتم تقسيمه داخليًا، ثم إخراج ملف MP3 واحد من الـserver.py الموجود عندك.

والأهم: لا أنصح بتغيير الكلمات الخليجية أو تحويل أ/إ/آ إلى ا؛ النسخة السابقة كانت تفعل ذلك وقد تفسد نطق الشعر. هذه النسخة تترك النص الذي تكتبه كما هو تقريبًا، مع تنظيف المسافات فقط.

أما المحافظة على النبرة الخليجية، فالعامل الأكبر هنا هو جودة reference_01/02/03.wav. إذا كانت الثلاثة لنفس المتحدث وبها كلام خليجي واضح ونظيف، فالـXTTS سيأخذ منها الـconditioning نفسه لكل مقاطع النص

  • ✅ Python 3.11.9
  • ✅ PyTorch 2.8 CPU
  • ✅ TorchAudio 2.8 CPU
  • ✅ TorchCodec 0.7.0
  • ✅ FFmpeg 7.1.1 Shared ويعمل
  • ✅ Coqui TTS 0.27.5
  • ✅ Transformers تم إصلاحه
  • ✅ XTTS v2 يعمل
  • ✅ voice_clone.py يعمل
  • ✅ FastAPI يعمل
  • ✅ الواجهة تعمل على 7860
  • ✅ index.html وCSS وJavaScript يتم تحميلها
  • ✅ رفع الصوت يصل إلى السيرفر
  • ✅ توليد الصوت يعمل

لكن أقول إن المشروع مكتمل كـ نسخة تشغيلية، وليس بالضرورة أن جودة استنساخ الصوت وصلت للمستوى الاحترافي الذي تريده.

المرحلة المتبقية اختيارية: تحسين النطق العربي + النبرة الخليجية + جودة المرجع + سرعة CPU.

نحذف الملفات المؤقتة فقط عند الخروج، ونحافظ دائمًا على المراجع الثلاثة:

voices/
├── reference_01.wav ← لا يُحذف
├── reference_02.wav ← لا يُحذف
└── reference_03.wav ← لا يُحذف

أما الملفات التي ينشئها التطبيق مثل الأصوات المرفوعة والناتجة في outputs فيمكن تنظيفها.

إذا تريد أمرًا بسيطًا داخل voice_clone.py، أضف في آخر الملف:

import atexit

 
def cleanup_project_files():
# تنظيف outputs
if OUTPUTS_DIR.exists():
for file in OUTPUTS_DIR.iterdir():
try:
if file.is_file():
file.unlink()
except Exception:
pass

 
# تنظيف voices مع الحفاظ على المراجع الثلاثة
protected = {
"reference_01.wav",
"reference_02.wav",
"reference_03.wav",
}

 
if VOICES_DIR.exists():
for file in VOICES_DIR.iterdir():
try:
if file.is_file() and file.name.lower() not in protected:
file.unlink()
except Exception:
pass

 
# تنظيف الملفات المؤقتة
if TEMP_DIR.exists():
for file in TEMP_DIR.iterdir():
try:
if file.is_file():
file.unlink()
except Exception:
pass

 
atexit.register(cleanup_project_files)

النتيجة

عند إغلاق البرنامج بشكل طبيعي:

voices/
├── reference_01.wav
├── reference_02.wav
└── reference_03.wav

تبقى ثابتة.

بينما:

outputs/

يتم تنظيف الملفات التي أنشأها التطبيق.

و:

temp/

يتم تنظيف الملفات المؤقتة.

مهم: هذا يعمل عند إغلاق Python بشكل طبيعي، وليس مضمونًا إذا أُغلقت العملية بالقوة من Task Manager.

*** اذا حبيت تجربه voice_clone101

إقرأ المزيد
author

الجمعة، 14 أغسطس 2026

Voice Hayef1.0 تحويل النص الى صوت

 في امر راح يثبت بحاسوبك انتبه :

  • ✅ اكتشف Python 3.12 تلقائيًا:
    C:\Users\zip\AppData\Local\Programs\Python\Python312\python.exe
  • ✅ أنشأ البيئة الافتراضية:
    D:\Voice-Hayef1.0-on\venv
  • ✅ ثبّت requirements.txt بنجاح.
  • edge-tts 7.2.8 مثبت.
  • fastapi 0.115.6 مثبت.
  • uvicorn 0.34.0 مثبت.
  • requests 2.32.3 مثبت.
  • python-multipart 0.0.20 مثبت.
  • loguru 0.7.3 مثبت.
  • ✅ ظهرت رسالة All required packages are available.
  • ✅ وفي النهاية أعطاك Installation Completed.
  • اذا حبيت تغير المسار براحتك : عندك الشرح

    هو Python الرئيسي المثبت في Windows.

    أما هذا: 

    D:\Voice-Hayef1.0-on\venv\

    فهو بيئة افتراضية خاصة بالمشروع، وتستخدم Python الموجود على الجهاز لإنشاء نسخة/بيئة معزولة للمشروع.

    بالتالي عندك مستويان:

    الحاسوب
    └── Python 3.12
    C:\Users\zip\AppData\Local\Programs\Python\Python312\
     
    المشروع
    └── Voice-Hayef1.0-on
    └── venv
    ├── Python
    └── مكتبات Voice-Hayef

    الميزة: المستخدم لا يحتاج إلى تثبيت مكتبات المشروع عالميًا؛ المكتبات تذهب إلى venv.

    لكن Python الأساسي نفسه يبقى مثبتًا على Windows حتى يستطيع venv العمل

    انا بصرحه احب عمله في المشروع بس هذي نسخه تجريبيه

    المهمةماذا يفعل؟
    🔍 فحص Pythonيتأكد هل Python موجود
    📥 تثبيت Pythonإذا لم يجده، يحاول تثبيته تلقائيًا عبر winget
    🐍 إنشاء Virtual Environmentينشئ مجلد venv للمشروع
    📦 تحديث pipيحدّث مدير حزم Python
    📚 تثبيت المتطلباتيقرأ requirements.txt ويثبت المكتبات
    🛑 كشف الأخطاءإذا فشل التثبيت، يتوقف ويخبرك بدل رسالة نجاح كاذبة
    ✅ التحقق من النجاحلا يقول Installation Completed إلا إذا نجحت الخطوات
    ▶️ تجهيز البرنامجيجعل البيئة جاهزة لتشغيل Voice-Hayef1.0

    بعد رفع المجلد

    ابدا في التثبيت

    install.bat

    الغير مثبته بحجم لاول مره وهو الافضل

    32.0 KB

    المثبته بالخدمات

    50.6 MB

    Voice-Hayef1.0 هو برنامج محلي لتحويل النصوص إلى ملفات صوت MP3 باستخدام تقنية Microsoft Edge TTS.

    يعمل البرنامج على جهاز المستخدم مباشرة بدون الحاجة إلى:

    • خوادم خارجية خاصة
    • قواعد بيانات
    • نماذج ذكاء اصطناعي ضخمة
    • كروت شاشة
    • ملفات Models

    وظيفته الأساسية:

    ✅ تكتب نص عربي أو إنجليزي
    ⬇️
    ✅ يكتشف اللغة تلقائياً
    ⬇️
    ✅ يختار صوت مناسب
    ⬇️
    ✅ ينشئ ملف MP3
    ⬇️
    ✅ يشغله داخل المتصفح
    ⬇️
    ✅ يسمح بتحميله

    ام المدعوم

    يعمل على:

    ✅ Windows 10
    ✅ Windows 11

    يفضل:

    • Windows 10 64-bit
    • Windows 11 64-bit

    تحويل النص إلى صوت

    مثال:

    النص:

    مرحبا هذا اختبار Voice-Hayef1.0

    النتيجة:

    Voice-Hayef1.0_xxxxx.mp3

    داخل:

    Output

     متطلبات الجهاز

    يفضل:

    المعالج

    أي:

    • Intel i3 أو أعلى
    • Ryzen 3 أو أعلى

    الرام

    الحد الأدنى:

    4 GB

    المفضل:

    8 GB

    التخزين

    يفضل:

    500 MB مساحة فارغة

    ✅ Python 3.11
    ✅ venv مستقل
    ✅ FastAPI
    ✅ Uvicorn
    ✅ Edge-TTS 7.2.8
    ✅ بدون PyTorch
    ✅ بدون CUDA
    ✅ بدون Models
    ✅ بدون Visual Studio
    ✅ واجهة عربية
    ✅ إنشاء MP3
    ✅ تشغيل الصوت
    ✅ تحميل الصوت
    ✅ Logs

    إقرأ المزيد
    author

    شرح كيف تنتج ملفين ل onnx و json لصوتيات لاي برمجه تحتاجها

     إنشاء صوت خليجي يعمل مع Piper TTS وينتج ملفين:

    • voice.onnx
    • voice.onnx.json

    فهذه هي الطريقة العملية خطوة بخطوة.


    الخطوة 1: تجهيز نظام التشغيل

    يفضل استخدام Ubuntu 22.04 أو Windows مع WSL2.

    ثبت الأدوات:

    sudo apt update
    
    sudo apt install git ffmpeg python3 python3-pip

    ثم:

    git clone https://github.com/rhasspy/piper
    cd piper

    الخطوة 2: إنشاء قاعدة البيانات

    سجل صوت المتحدث باللهجة الخليجية.

    يفضل:

    • 5–20 ساعة
    • بدون ضوضاء
    • ميكروفون جيد
    • WAV
    • Mono
    • 22050 Hz أو 24000 Hz

    مثال:

    0001.wav
    0002.wav
    0003.wav

    الخطوة 3: كتابة النصوص

    أنشئ ملفًا يسمى:

    metadata.csv

    مثال:

    0001|السلام عليكم ورحمة الله
    0002|شلونك اليوم
    0003|وين رايح
    0004|أنا من الكويت
    0005|اليوم الجو جميل

    الصيغة:

    اسم الملف|النص

    الخطوة 4: تنظيف الصوت

    استخدم ffmpeg:

    ffmpeg -i input.wav -ar 22050 -ac 1 output.wav

    لكل الملفات.


    الخطوة 5: تجهيز البيانات

    داخل Piper:

    python3 preprocess.py \
    --dataset-dir dataset \
    --language ar

    سينتج ملفات التدريب.


    الخطوة 6: التدريب

    ابدأ التدريب:

    python3 train.py \
    --dataset dataset \
    --epochs 50000

    قد يستغرق:

    • ساعات
    • أو أيام

    حسب كرت الشاشة.


    الخطوة 7: الحصول على أفضل نموذج

    سيظهر مجلد مثل:

    checkpoints/
    
    epoch=1000.ckpt
    epoch=2000.ckpt
    ...

    اختر أفضل Checkpoint.


    الخطوة 8: تحويله إلى ONNX

    نفذ:

    python3 export_onnx.py \
    --checkpoint checkpoints/best.ckpt \
    --output gulf_voice.onnx

    الناتج:

    gulf_voice.onnx

    الخطوة 9: إنشاء ملف JSON

    يمكن إنشاؤه يدويًا.

    مثال:

    {
      "audio": {
        "sample_rate": 22050
      },
      "language": {
        "code": "ar"
      },
      "speaker_id_map": {
        "0": "gulf"
      },
      "num_speakers": 1,
      "phoneme_type": "espeak",
      "inference": {
        "noise_scale": 0.667,
        "length_scale": 1.0,
        "noise_w": 0.8
      }
    }

    ثم احفظه باسم:

    gulf_voice.onnx.json

    الخطوة 10: الاختبار

    echo "شلونك" | \
    piper \
    --model gulf_voice.onnx \
    --config gulf_voice.onnx.json \
    --output_file out.wav

    ستنتج:

    out.wav

    هل يمكن صنع صوت خليجي بدون تدريب كامل؟

    نعم، إذا لم يكن لديك عشرات الساعات من التسجيل، يمكنك استخدام نموذج عربي جاهز ثم إجراء Fine-tuning على 30–60 دقيقة من صوت المتحدث الخليجي. هذا أسرع بكثير ويعطي نتائج جيدة في كثير من الحالات.

    ما الذي ستحتاجه؟

    • بطاقة رسومية NVIDIA بذاكرة لا تقل عن 12 جيجابايت (كلما زادت كان التدريب أسرع).
    • من 5 إلى 20 ساعة من تسجيلات صوتية نظيفة للحصول على أفضل جودة، أو مدة أقصر إذا كنت ستجري Fine-tuning على نموذج عربي موجود.
    • نصوص مطابقة لكل تسجيل صوتي.

    إذا أردت بناء صوت خليجي احترافي من الصفر، أستطيع أن أشرح لك العملية كاملة، بدءًا من تسجيل البيانات وحتى إنتاج ملفي .onnx و**.onnx.json** مع جميع الأوامر اللازمة، في دليل مفصل يتضمن أكثر من 30 خطوة.

    ابحث خدمتك في الذكاء الاصطناعي عطيتك الفكره : كيف معكم اخوكم هايف السفراني العجمي kuwaiT

    تم عمل ملفات خليجي بذات كويتي بجميع الاصوات باسلوب بدوي ومحلي عام بلا اي كلمات عوج اللسان بالي -1

    2- وتم عمل برمجه بانشاء كيف تكون الملفين  باسرع وقت معي اجمل الاضافات معروض لبيع يمكنك المشاهده

    الاصدار الاول مرخص وهو

    نبذه عن مشروع هايف العجمي تحويل الصوت الى ناطق بشري بنبره خليجي كويتي بدوي الاصدار الاول على الويندوز KuwaitVoiceTrainer1.0 - onnx-json-wav

    وتحت التطوير النسخه المعروضه لبيع تشتغل على الرفع بالاستضافات والجوالات والحاسوب / انا اسهل عليكم كيف تعمل احسن من خدماتي :)

    الانترنت بين ادينك بس موضوع يحتاج صبر

    عمل صوت باللهجه الكويتيه البدويه اعداد هايف العجمي

    https://maereab.blogspot.com/2026/08/artificial-intelligence.html

    فصل صوت المغني عن الموسيقى الاصدار الاول Python 3.11 بدون Sng hayef5Mus مصدر مفتوح التشغيل ويندوز

    وتابع جديدنا

    إقرأ المزيد
    author

    نبذه عن مشروع هايف العجمي تحويل الصوت الى ناطق بشري بنبره خليجي كويتي بدوي الاصدار الاول على الويندوز KuwaitVoiceTrainer1.0 - onnx-json-wav

     تشغيل مشروع KuwaitVoice على CPU فقط وتريد أسرع استجابة ممكنة، فأفضل اختيار حاليًا هو جهاز مكتبي بمحطة عمل قوية، وليس لابتوب.

    أفضل خيار CPU

    AMD Ryzen Threadripper PRO 9995WX

    لديه 96 نواة / 192 خيطًا وتردد Boost يصل إلى 5.4 GHz، وTDP افتراضي 350W. وهو حاليًا من أقوى معالجات محطات العمل متعددة الخيوط؛ PassMark يضعه في المركز الأول في الأداء متعدد الخيوط ضمن قاعدة الاختبارات التي يعرضها.

    مواصفات جهاز مناسب لمشروعك:

    القطعةالمواصفة المقترحة
    CPUThreadripper PRO 9995WX
    RAM128 GB DDR5 ECC كحد أدنى
    SSD2 TB NVMe للنظام + 4 TB NVMe للمشروع/البيانات
    GPUلا تحتاجه لتشغيل نسختك الحالية CPU-only، لكن بطاقة منفصلة مطلوبة لمنصة Threadripper PRO نفسها
    النظامWindows 11 Pro 64-bit
    التبريدتبريد قوي جدًا
    PSUمزود طاقة عالي الجودة

    AMD نفسها تصنف Threadripper PRO كمعالجات مخصصة لمحطات العمل، والـ9995WX تحديدًا يأتي بـ96 نواة و192 خيطًا و350W.

    لكن عندك نقطة مهمة

    لا أريد أن أوحي بأن 9995WX سيجعل تدريب Piper أسرع 10 أو 20 مرة تلقائيًا. مشروعك الحالي يعتمد على PyTorch/Lightning وإعدادات Piper، والاستفادة من عدد كبير جدًا من الأنوية تعتمد على كيفية توزيع العمل وخصائص الـDataLoader والتدريب.

    لذلك، لو كنت ستشتري جهازًا خصيصًا لـKuwaitVoice، فترتيبي:

    أقصى قوة CPU: Threadripper PRO 9995WX.

    جهاز أقوى اقتصاديًا/عمليًا: معالج Ryzen مكتبي قوي بعدد أنوية مرتفع، مع RAM كبيرة وNVMe سريع. سيكون أسهل وأرخص بكثير من محطة Threadripper.

    نبذه عن :

    • CPU = المعالج الرئيسي للكمبيوتر 🧠
    • GPU = معالج الرسوميات، وممتاز في تنفيذ عدد كبير من العمليات بالتوازي ⚡

    الفرق الأساسي

     CPUGPU
    الوظيفةتشغيل النظام والبرامج والمهام العامةالرسوميات والذكاء الاصطناعي والعمليات المتوازية
    عدد الأنويةأقل عادةً، لكنها قوية ومرنةعدد كبير جدًا من الأنوية
    الذكاء الاصطناعييعمل، لكن أبطأ في التدريب غالبًاأسرع بكثير في تدريب نماذج كثيرة
    الألعابمهم جدًامهم جدًا للرسوميات
    استهلاك الطاقةعادة أقلعادة أعلى
    مثالIntel Core / AMD RyzenNVIDIA RTX / AMD Radeon

    في المشروع انا استخدمه CPU واذا حاسوبك ضعيف الله يعينك راح ياخذ ساعاه او حتى يوم كامل لانتاج الملفين

    voice.onnx
    voice.onnx.json

    والاضافات لنقله لاي مشروح تحتاجه او ترفعه لانترنت

    وعملت نوذج اخر ترفع فيها الملفين وتبدع براحتك

    1- AI-Voice-System

    2- My-Kuwaiti-AI

    وغيرها تجدها هنا

    وعملت لخدمه هذي :

    1- Sng-hayef5Mus فصل صوت المغني عن الموسيقى الاصدار الاول

    * تجربه لتسجيل مقطع يخصك وتتبع الهدف المناسب

    40% كلام كويتي يومي
    20% أسئلة وأجوبة
    15% أرقام وتواريخ وأوقات
    15% جمل فيها حروف وأصوات عربية صعبة
    10% جمل أطول قليلًا

    الأفضل أن تبني Dataset أطول ومتنوّعًا، مع تسجيل نفس المتحدث فقط وبنفس الميكروفون والبيئة. إرشادات Piper تؤكد أن جودة التسجيل وتطابق الصوت والنص أهم من مجرد عدد الملفات، وأن المقاطع تكون عند فواصل الجمل، و22.05 kHz mono مناسب لنسختك.

    النموذج الذي أقترحه لك

    للتجربة الواقعية الأولى، استهدف تقريبًا:

    المستوىعدد المقاطع التقريبيمدة الكلام
    اختبار سريع100–20010–20 دقيقة
    تجربة واقعية مناسبة لك400–80045–90 دقيقة
    جودة أعلى1000+1–2+ ساعة

    هذه ليست أرقامًا إلزامية؛ Piper نفسه يذكر أن حتى دقائق قليلة تكفي كبداية، وأن زيادة البيانات عالية الجودة تحسن النتيجة، وهناك نقاشات من مجتمع Piper تؤكد أن جودة وكمية البيانات أهم من رفع عدد Epochs فقط

    سينتج لك تلقائي في لمشروع هكذا

    001.wav → metadata: 001

    مرقم لصوت والكلام

    أهم شيء أثناء التسجيل

    لا تسجل 500 جملة دفعة واحدة. قسمها إلى جلسات، وحافظ قدر الإمكان على نفس الميكروفون والمسافة ومستوى الصوت. لا تغيّر الغرفة أو الصدى بين الجلسات، ولا تضع موسيقى أو ضوضاء خلفية. جودة التسجيل والتفريغ الصحيح لها تأثير مباشر على جودة نموذج

    الشرح متعب جدا وياخذ وقتتتتتتتتتتتتتتتتتتتتتتتتتتت : سهلت عليك المهم الان ارفع في مشروعي اي صوت  وينتج لك الملفين وسلام عليكم

    واجهه احترافيه وسهله الاستخدام لاي شخص يبحث عن صنع اصوات خليجيه بذات وتم انشاء الخدمه لدولتي الكويت
    وبالتحديد باللهجه البدويه رمز قوه ابناء الجزيره العربيه
    معي اني تعبت في الخدمات الكثيره لذكاء الاصطناعي والبحث عن اصوات خليجيه
    كمثال لكويت بنبره صوت مرجعي كما ينقال بالبرمجه المهم وجده اسهل الطرق الغير معقده للكثير اللى ما يعرف عالم البرمجه والخوارزمية

    * البرمجه عملتها بفكرتي وتدبيري لتكون سهله جدا : بس ترفع المجلد وتضغط التثبيت يكون نفسه تلقائي *
    بدل البرمجه المعقده المنتشره المتفوحه -
    وخصصه التطبيق يشتغل على الويندوز 64 بت فقط
    Windows 10-11
    تخرج صفحه ويب index.html بكل احتراف
    - كل ما صار حاسوبك قوي بالخدمات انت فوق السحاب مرتاح
    مثبت بالخدمه
    ينزّل تلقائيًا:
    Python 3.11
    Piper + training dependencies
    Cython/متطلبات monotonic_align
    FFmpeg
    Whisper.cpp
    Whisper model
    Node packages
    لا يعتمد على Python موجود عند المستخدم.
    لا يعتمد على PATH الموجود عند المستخدم؛ يستخدم المسارات داخل المشروع، ويمكنه تعديل PATH عند الحاجة.
    يعالج monotonic_align فعليًا بدل فحصه فقط. وثائق Piper الرسمية نفسها توضح أن تدريب الصوت يحتاج بناء امتداد monotonic_align بعد تثبيت
    وغيرها

    قبل التثبيت حجمه
    32.9 MB

    بسبب الصوت فقط هذا الحجم wav

    HaYeF5-VoiceTrainer-onnx-json-wav


    بعد التثبيت للاسف اكثر من
    4.91 GB
    بس يستاهل
     

    شكل المشروع

    KuwaitVoiceTrainer/

    ├── install.bat ← المستخدم يشغله مرة واحدة
    ├── start.bat ← المستخدم يشغله بعد التثبيت

    ├── server.js ← يبقى أساس المشروع
    ├── package.json ← يبقى أساس المشروع

    ├── public/
    │ ├── index.html
    │ ├── app.js
    │ ├── style.css
    │ └── ...

    ├── engine/
    │ ├── ffmpeg.exe
    │ ├── ffprobe.exe
    │ ├── whisper-cli.exe
    │ └── ggml-large-v3-turbo-q5_0.bin

    ├── runtime/
    │ ├── uv.exe
    │ ├── python/
    │ ├── venv/
    │ ├── piper/
    │ └── cache/

    ├── input/

    ├── dataset/
    │ ├── metadata.csv
    │ └── wav/

    ├── training/
    │ ├── cache/
    │ ├── checkpoints/
    │ ├── logs/
    │ └── processed/

    ├── voices/
    │ └── kw_male/
    │ ├── voice.onnx
    │ └── voice.onnx.json

    └── logs/


    مراحل التطبيق :

    عندك سبع مراحل
    1- الصوت
    2- تحيل التسجيل وحاله النظام
    4- مراجعه النص وتضغط انشاء
    5- خروج مثل
    ✓ تم إنشاء Dataset بنجاح.
    dataset/metadata.csv
    dataset/wav/
    6- تدريب نموذج الصوت بدء وتنتظر
    أنت حاليًا تستخدم:
    --trainer.accelerator cpu
    --trainer.devices 1
    --trainer.max_epochs 10000
    وهذا يعني أن التدريب مجبور على المعالج CPU، وليس كرت الشاشة. و10000 Epochs رقم كبير جدًا.
    هل يمكن تسريعه؟
    نعم، وبشكل كبير إذا كان جهازك يملك NVIDIA GPU يدعم CUDA.
    أما إذا كان التدريب على CPU فقط، فنستطيع تحسين الإعدادات، لكن لن يصبح سريعًا مثل GPU.
    * واذا حبيت تسرعه فقط التعديل في train.bat
    بس كل ماصار كمبيوترك خدماته عاليه لا يحتاج
    7- النموذج النهائي - هو الاهم سوف يتخير اللون الاحمر الى اخضر ومبروك

    خلك على المجلد KuwaitVoiceTrainer
    وارفعه في الدي اذا مساحتك تكفي تنبيه :
    شرح التشغيل لاول مره اضغط على  install.bat

    ياخذ وقت على التنزيل
    وبعدها سكرها :)
    والضغط على هذا لتشغيله في اي وقت start.bat

    1- ارفع اي مقطع صوت wav ويسمح لاي صيغه اخره بس يفضل عزل الصوت من المسيقه
    وعندك برمجه عملتها لهذا الغرض
    او استخدم الخدمات اللى تتيح لك مجاني وهي محدوده
    https://vocalremover.org/ar/
    بعدها يخرج لك بمسار
    D:\KuwaitVoiceTrainer\dataset
    مجلد ويب wav وتحتها مثل
    المقاطع اللى تم تقطيعه بمثال
    000001
    metadata.csv هنا راح تجد مثل 000001 والجمله او الاغنيه مرتب + ويمكنك التعديل
    و
    whisper.json
    --
    وعندك مجلد training يمكنك مسحه يدوي اذا تبي تسوي تطبيق اخر ويمكن تركه بس مسحه افضل
    --
    * D:\KuwaitVoiceTrainer\voices
    صراحه شرح الخدمه معقد حنا لنا المهم في صنع : صوت معين انا مثبت ل مجلد kw_male
    ويوجد مجلد kw_female

    وهمنا نخرج صوت معين كرجل كويتي يتكلم بالنبره المطلوبه البداويه

    راح يتكون ملفين
    voice.onnx ل json

    لرفعها في اي مشروح مثل اللى عملته
    * اكتب نص وانتظر يحوله الى صوت

    تم عمل نسخه للويندوز لانشاء onnx و jsonبرفع مقطع صوتي وتقطيعه ووضع ترجم لاي صوت برمجه هايف السفراني مجاني

    -*******-

    مشروع KuwaitVoice Trainer الحالي مصمم ليعمل محليًا على Windows x64، وكل خدماته داخل مجلد المشروع:

    runtime\
    engine\
    node_modules\
    dataset\
    training\
    voices\
    input\
    public\

    لذلك تستطيع نقل مجلد المشروع كاملًا إلى كمبيوتر Windows آخر وتشغيله هناك، لكن يجب أن يكون الجهاز مناسبًا للتدريب من حيث المعالج والذاكرة ومساحة التخزين، وقد تحتاج إعادة تشغيل install.bat على الجهاز الجديد لتجهيز الخدمات محليًا.

    أما رفعه إلى استضافة ويب عادية أو cPanel فلن يعمل بهذا الشكل، لأن المشروع يعتمد على Python/Piper/Whisper/FFmpeg وتشغيل عمليات محلية طويلة.

    وللنشر على جهاز آخر، لا تحتاج نقل:

    node_modules\
    runtime\
    engine\

    كدائمًا؛ يمكن إعادة تجهيزها بواسطة install.bat، بينما تنقل بياناتك المهمة مثل:

    dataset\
    voices\
    training\
    input\

    بحسب ما تريد الاحتفاظ به.

    إذا كان قصدك تشغيله على VPS أو سيرفر بعيد بدل الكمبيوتر الشخصي، فذلك ممكن أيضًا، لكن مواصفات وطريقة النشر تختلف

    ملاحظات :

    * لم اعمل النسخه بالشكل الاحترافي بسبب ضعف حاسوبي

    - في كل عمل تسويه يمكنك تمسح مافي هذي المجلدات فقط

    dataset وفي داخله الويب لصوتيات التى تم تجزئها

    - وهذا logs

    وهذا training

    اسم النسخه

    النسخه الاوله لويندوز تحويل الصوت الى كلام وتقطيعه واستخراج voice.onnx و WAV لانتاج صوت خليجي بالنبره

    * سويت لكم نسخه مجانيه  بلا اي تعقيد

    - واجهه ويب محترفه

    * سبع مراحل !

    شاهد الفيديو

     

    وتابع جديدنا

    إقرأ المزيد
    author