اخر المواضيع

آخر الأخبار
إختر لونك المفضل

عرض المحتوي

بحث

الجمعة، 14 أغسطس 2026

نبذه عن مشروع هايف العجمي تحويل الصوت الى ناطق بشري بنبره خليجي كويتي بدوي الاصدار الاول على الويندوز KuwaitVoiceTrainer1.0 - onnx-json-wav

السفراني | أغسطس 14, 2026 |
السلام عليكم

 تشغيل مشروع KuwaitVoice على CPU فقط وتريد أسرع استجابة ممكنة، فأفضل اختيار حاليًا هو جهاز مكتبي بمحطة عمل قوية، وليس لابتوب.

أفضل خيار CPU

AMD Ryzen Threadripper PRO 9995WX

لديه 96 نواة / 192 خيطًا وتردد Boost يصل إلى 5.4 GHz، وTDP افتراضي 350W. وهو حاليًا من أقوى معالجات محطات العمل متعددة الخيوط؛ PassMark يضعه في المركز الأول في الأداء متعدد الخيوط ضمن قاعدة الاختبارات التي يعرضها.

مواصفات جهاز مناسب لمشروعك:

القطعةالمواصفة المقترحة
CPUThreadripper PRO 9995WX
RAM128 GB DDR5 ECC كحد أدنى
SSD2 TB NVMe للنظام + 4 TB NVMe للمشروع/البيانات
GPUلا تحتاجه لتشغيل نسختك الحالية CPU-only، لكن بطاقة منفصلة مطلوبة لمنصة Threadripper PRO نفسها
النظامWindows 11 Pro 64-bit
التبريدتبريد قوي جدًا
PSUمزود طاقة عالي الجودة

AMD نفسها تصنف Threadripper PRO كمعالجات مخصصة لمحطات العمل، والـ9995WX تحديدًا يأتي بـ96 نواة و192 خيطًا و350W.

لكن عندك نقطة مهمة

لا أريد أن أوحي بأن 9995WX سيجعل تدريب Piper أسرع 10 أو 20 مرة تلقائيًا. مشروعك الحالي يعتمد على PyTorch/Lightning وإعدادات Piper، والاستفادة من عدد كبير جدًا من الأنوية تعتمد على كيفية توزيع العمل وخصائص الـDataLoader والتدريب.

لذلك، لو كنت ستشتري جهازًا خصيصًا لـKuwaitVoice، فترتيبي:

أقصى قوة CPU: Threadripper PRO 9995WX.

جهاز أقوى اقتصاديًا/عمليًا: معالج Ryzen مكتبي قوي بعدد أنوية مرتفع، مع RAM كبيرة وNVMe سريع. سيكون أسهل وأرخص بكثير من محطة Threadripper.

نبذه عن :

  • CPU = المعالج الرئيسي للكمبيوتر 🧠
  • GPU = معالج الرسوميات، وممتاز في تنفيذ عدد كبير من العمليات بالتوازي ⚡

الفرق الأساسي

 CPUGPU
الوظيفةتشغيل النظام والبرامج والمهام العامةالرسوميات والذكاء الاصطناعي والعمليات المتوازية
عدد الأنويةأقل عادةً، لكنها قوية ومرنةعدد كبير جدًا من الأنوية
الذكاء الاصطناعييعمل، لكن أبطأ في التدريب غالبًاأسرع بكثير في تدريب نماذج كثيرة
الألعابمهم جدًامهم جدًا للرسوميات
استهلاك الطاقةعادة أقلعادة أعلى
مثالIntel Core / AMD RyzenNVIDIA RTX / AMD Radeon

في المشروع انا استخدمه CPU واذا حاسوبك ضعيف الله يعينك راح ياخذ ساعاه او حتى يوم كامل لانتاج الملفين

voice.onnx
voice.onnx.json

والاضافات لنقله لاي مشروح تحتاجه او ترفعه لانترنت

وعملت نوذج اخر ترفع فيها الملفين وتبدع براحتك

1- AI-Voice-System

2- My-Kuwaiti-AI

وغيرها تجدها هنا

وعملت لخدمه هذي :

1- Sng-hayef5Mus فصل صوت المغني عن الموسيقى الاصدار الاول

* تجربه لتسجيل مقطع يخصك وتتبع الهدف المناسب

40% كلام كويتي يومي
20% أسئلة وأجوبة
15% أرقام وتواريخ وأوقات
15% جمل فيها حروف وأصوات عربية صعبة
10% جمل أطول قليلًا

الأفضل أن تبني Dataset أطول ومتنوّعًا، مع تسجيل نفس المتحدث فقط وبنفس الميكروفون والبيئة. إرشادات Piper تؤكد أن جودة التسجيل وتطابق الصوت والنص أهم من مجرد عدد الملفات، وأن المقاطع تكون عند فواصل الجمل، و22.05 kHz mono مناسب لنسختك.

النموذج الذي أقترحه لك

للتجربة الواقعية الأولى، استهدف تقريبًا:

المستوىعدد المقاطع التقريبيمدة الكلام
اختبار سريع100–20010–20 دقيقة
تجربة واقعية مناسبة لك400–80045–90 دقيقة
جودة أعلى1000+1–2+ ساعة

هذه ليست أرقامًا إلزامية؛ Piper نفسه يذكر أن حتى دقائق قليلة تكفي كبداية، وأن زيادة البيانات عالية الجودة تحسن النتيجة، وهناك نقاشات من مجتمع Piper تؤكد أن جودة وكمية البيانات أهم من رفع عدد Epochs فقط

سينتج لك تلقائي في لمشروع هكذا

001.wav → metadata: 001

مرقم لصوت والكلام

أهم شيء أثناء التسجيل

لا تسجل 500 جملة دفعة واحدة. قسمها إلى جلسات، وحافظ قدر الإمكان على نفس الميكروفون والمسافة ومستوى الصوت. لا تغيّر الغرفة أو الصدى بين الجلسات، ولا تضع موسيقى أو ضوضاء خلفية. جودة التسجيل والتفريغ الصحيح لها تأثير مباشر على جودة نموذج

الشرح متعب جدا وياخذ وقتتتتتتتتتتتتتتتتتتتتتتتتتتت : سهلت عليك المهم الان ارفع في مشروعي اي صوت  وينتج لك الملفين وسلام عليكم

واجهه احترافيه وسهله الاستخدام لاي شخص يبحث عن صنع اصوات خليجيه بذات وتم انشاء الخدمه لدولتي الكويت
وبالتحديد باللهجه البدويه رمز قوه ابناء الجزيره العربيه
معي اني تعبت في الخدمات الكثيره لذكاء الاصطناعي والبحث عن اصوات خليجيه
كمثال لكويت بنبره صوت مرجعي كما ينقال بالبرمجه المهم وجده اسهل الطرق الغير معقده للكثير اللى ما يعرف عالم البرمجه والخوارزمية

* البرمجه عملتها بفكرتي وتدبيري لتكون سهله جدا : بس ترفع المجلد وتضغط التثبيت يكون نفسه تلقائي *
بدل البرمجه المعقده المنتشره المتفوحه -
وخصصه التطبيق يشتغل على الويندوز 64 بت فقط
Windows 10-11
تخرج صفحه ويب index.html بكل احتراف
- كل ما صار حاسوبك قوي بالخدمات انت فوق السحاب مرتاح
مثبت بالخدمه
ينزّل تلقائيًا:
Python 3.11
Piper + training dependencies
Cython/متطلبات monotonic_align
FFmpeg
Whisper.cpp
Whisper model
Node packages
لا يعتمد على Python موجود عند المستخدم.
لا يعتمد على PATH الموجود عند المستخدم؛ يستخدم المسارات داخل المشروع، ويمكنه تعديل PATH عند الحاجة.
يعالج monotonic_align فعليًا بدل فحصه فقط. وثائق Piper الرسمية نفسها توضح أن تدريب الصوت يحتاج بناء امتداد monotonic_align بعد تثبيت
وغيرها

قبل التثبيت حجمه
32.9 MB

بسبب الصوت فقط هذا الحجم wav

HaYeF5-VoiceTrainer-onnx-json-wav


بعد التثبيت للاسف اكثر من
4.91 GB
بس يستاهل
 

شكل المشروع

KuwaitVoiceTrainer/

├── install.bat ← المستخدم يشغله مرة واحدة
├── start.bat ← المستخدم يشغله بعد التثبيت

├── server.js ← يبقى أساس المشروع
├── package.json ← يبقى أساس المشروع

├── public/
│ ├── index.html
│ ├── app.js
│ ├── style.css
│ └── ...

├── engine/
│ ├── ffmpeg.exe
│ ├── ffprobe.exe
│ ├── whisper-cli.exe
│ └── ggml-large-v3-turbo-q5_0.bin

├── runtime/
│ ├── uv.exe
│ ├── python/
│ ├── venv/
│ ├── piper/
│ └── cache/

├── input/

├── dataset/
│ ├── metadata.csv
│ └── wav/

├── training/
│ ├── cache/
│ ├── checkpoints/
│ ├── logs/
│ └── processed/

├── voices/
│ └── kw_male/
│ ├── voice.onnx
│ └── voice.onnx.json

└── logs/


مراحل التطبيق :

عندك سبع مراحل
1- الصوت
2- تحيل التسجيل وحاله النظام
4- مراجعه النص وتضغط انشاء
5- خروج مثل
✓ تم إنشاء Dataset بنجاح.
dataset/metadata.csv
dataset/wav/
6- تدريب نموذج الصوت بدء وتنتظر
أنت حاليًا تستخدم:
--trainer.accelerator cpu
--trainer.devices 1
--trainer.max_epochs 10000
وهذا يعني أن التدريب مجبور على المعالج CPU، وليس كرت الشاشة. و10000 Epochs رقم كبير جدًا.
هل يمكن تسريعه؟
نعم، وبشكل كبير إذا كان جهازك يملك NVIDIA GPU يدعم CUDA.
أما إذا كان التدريب على CPU فقط، فنستطيع تحسين الإعدادات، لكن لن يصبح سريعًا مثل GPU.
* واذا حبيت تسرعه فقط التعديل في train.bat
بس كل ماصار كمبيوترك خدماته عاليه لا يحتاج
7- النموذج النهائي - هو الاهم سوف يتخير اللون الاحمر الى اخضر ومبروك

خلك على المجلد KuwaitVoiceTrainer
وارفعه في الدي اذا مساحتك تكفي تنبيه :
شرح التشغيل لاول مره اضغط على  install.bat

ياخذ وقت على التنزيل
وبعدها سكرها :)
والضغط على هذا لتشغيله في اي وقت start.bat

1- ارفع اي مقطع صوت wav ويسمح لاي صيغه اخره بس يفضل عزل الصوت من المسيقه
وعندك برمجه عملتها لهذا الغرض
او استخدم الخدمات اللى تتيح لك مجاني وهي محدوده
https://vocalremover.org/ar/
بعدها يخرج لك بمسار
D:\KuwaitVoiceTrainer\dataset
مجلد ويب wav وتحتها مثل
المقاطع اللى تم تقطيعه بمثال
000001
metadata.csv هنا راح تجد مثل 000001 والجمله او الاغنيه مرتب + ويمكنك التعديل
و
whisper.json
--
وعندك مجلد training يمكنك مسحه يدوي اذا تبي تسوي تطبيق اخر ويمكن تركه بس مسحه افضل
--
* D:\KuwaitVoiceTrainer\voices
صراحه شرح الخدمه معقد حنا لنا المهم في صنع : صوت معين انا مثبت ل مجلد kw_male
ويوجد مجلد kw_female

وهمنا نخرج صوت معين كرجل كويتي يتكلم بالنبره المطلوبه البداويه

راح يتكون ملفين
voice.onnx ل json

لرفعها في اي مشروح مثل اللى عملته
* اكتب نص وانتظر يحوله الى صوت

تم عمل نسخه للويندوز لانشاء onnx و jsonبرفع مقطع صوتي وتقطيعه ووضع ترجم لاي صوت برمجه هايف السفراني مجاني

-*******-

مشروع KuwaitVoice Trainer الحالي مصمم ليعمل محليًا على Windows x64، وكل خدماته داخل مجلد المشروع:

runtime\
engine\
node_modules\
dataset\
training\
voices\
input\
public\

لذلك تستطيع نقل مجلد المشروع كاملًا إلى كمبيوتر Windows آخر وتشغيله هناك، لكن يجب أن يكون الجهاز مناسبًا للتدريب من حيث المعالج والذاكرة ومساحة التخزين، وقد تحتاج إعادة تشغيل install.bat على الجهاز الجديد لتجهيز الخدمات محليًا.

أما رفعه إلى استضافة ويب عادية أو cPanel فلن يعمل بهذا الشكل، لأن المشروع يعتمد على Python/Piper/Whisper/FFmpeg وتشغيل عمليات محلية طويلة.

وللنشر على جهاز آخر، لا تحتاج نقل:

node_modules\
runtime\
engine\

كدائمًا؛ يمكن إعادة تجهيزها بواسطة install.bat، بينما تنقل بياناتك المهمة مثل:

dataset\
voices\
training\
input\

بحسب ما تريد الاحتفاظ به.

إذا كان قصدك تشغيله على VPS أو سيرفر بعيد بدل الكمبيوتر الشخصي، فذلك ممكن أيضًا، لكن مواصفات وطريقة النشر تختلف

ملاحظات :

* لم اعمل النسخه بالشكل الاحترافي بسبب ضعف حاسوبي

- في كل عمل تسويه يمكنك تمسح مافي هذي المجلدات فقط

dataset وفي داخله الويب لصوتيات التى تم تجزئها

- وهذا logs

وهذا training

اسم النسخه

النسخه الاوله لويندوز تحويل الصوت الى كلام وتقطيعه واستخراج voice.onnx و WAV لانتاج صوت خليجي بالنبره

* سويت لكم نسخه مجانيه  بلا اي تعقيد

- واجهه ويب محترفه

* سبع مراحل !

شاهد الفيديو

 

وتابع جديدنا

author

ليست هناك تعليقات:

اضف تعليقك هنا