
تشغيل مشروع KuwaitVoice على CPU فقط وتريد أسرع استجابة ممكنة، فأفضل اختيار حاليًا هو جهاز مكتبي بمحطة عمل قوية، وليس لابتوب.
أفضل خيار CPU
AMD Ryzen Threadripper PRO 9995WX
لديه 96 نواة / 192 خيطًا وتردد Boost يصل إلى 5.4 GHz، وTDP افتراضي 350W. وهو حاليًا من أقوى معالجات محطات العمل متعددة الخيوط؛ PassMark يضعه في المركز الأول في الأداء متعدد الخيوط ضمن قاعدة الاختبارات التي يعرضها.
مواصفات جهاز مناسب لمشروعك:
| القطعة | المواصفة المقترحة |
|---|---|
| CPU | Threadripper PRO 9995WX |
| RAM | 128 GB DDR5 ECC كحد أدنى |
| SSD | 2 TB NVMe للنظام + 4 TB NVMe للمشروع/البيانات |
| GPU | لا تحتاجه لتشغيل نسختك الحالية CPU-only، لكن بطاقة منفصلة مطلوبة لمنصة Threadripper PRO نفسها |
| النظام | Windows 11 Pro 64-bit |
| التبريد | تبريد قوي جدًا |
| PSU | مزود طاقة عالي الجودة |
AMD نفسها تصنف Threadripper PRO كمعالجات مخصصة لمحطات العمل، والـ9995WX تحديدًا يأتي بـ96 نواة و192 خيطًا و350W.
لكن عندك نقطة مهمة
لا أريد أن أوحي بأن 9995WX سيجعل تدريب Piper أسرع 10 أو 20 مرة تلقائيًا. مشروعك الحالي يعتمد على PyTorch/Lightning وإعدادات Piper، والاستفادة من عدد كبير جدًا من الأنوية تعتمد على كيفية توزيع العمل وخصائص الـDataLoader والتدريب.
لذلك، لو كنت ستشتري جهازًا خصيصًا لـKuwaitVoice، فترتيبي:
أقصى قوة CPU: Threadripper PRO 9995WX.
جهاز أقوى اقتصاديًا/عمليًا: معالج Ryzen مكتبي قوي بعدد أنوية مرتفع، مع RAM كبيرة وNVMe سريع. سيكون أسهل وأرخص بكثير من محطة Threadripper.
نبذه عن :
- CPU = المعالج الرئيسي للكمبيوتر 🧠
- GPU = معالج الرسوميات، وممتاز في تنفيذ عدد كبير من العمليات بالتوازي ⚡
الفرق الأساسي
| CPU | GPU | |
|---|---|---|
| الوظيفة | تشغيل النظام والبرامج والمهام العامة | الرسوميات والذكاء الاصطناعي والعمليات المتوازية |
| عدد الأنوية | أقل عادةً، لكنها قوية ومرنة | عدد كبير جدًا من الأنوية |
| الذكاء الاصطناعي | يعمل، لكن أبطأ في التدريب غالبًا | أسرع بكثير في تدريب نماذج كثيرة |
| الألعاب | مهم جدًا | مهم جدًا للرسوميات |
| استهلاك الطاقة | عادة أقل | عادة أعلى |
| مثال | Intel Core / AMD Ryzen | NVIDIA RTX / AMD Radeon |
في المشروع انا استخدمه CPU واذا حاسوبك ضعيف الله يعينك راح ياخذ ساعاه او حتى يوم كامل لانتاج الملفين
voice.onnx
voice.onnx.json
والاضافات لنقله لاي مشروح تحتاجه او ترفعه لانترنت
وعملت نوذج اخر ترفع فيها الملفين وتبدع براحتك
1- AI-Voice-System
2- My-Kuwaiti-AI
وغيرها تجدها هنا
وعملت لخدمه هذي :
1- Sng-hayef5Mus فصل صوت المغني عن الموسيقى الاصدار الاول
* تجربه لتسجيل مقطع يخصك وتتبع الهدف المناسب
40% كلام كويتي يومي
20% أسئلة وأجوبة
15% أرقام وتواريخ وأوقات
15% جمل فيها حروف وأصوات عربية صعبة
10% جمل أطول قليلًا
الأفضل أن تبني Dataset أطول ومتنوّعًا، مع تسجيل نفس المتحدث فقط وبنفس الميكروفون والبيئة. إرشادات Piper تؤكد أن جودة التسجيل وتطابق الصوت والنص أهم من مجرد عدد الملفات، وأن المقاطع تكون عند فواصل الجمل، و22.05 kHz mono مناسب لنسختك.
النموذج الذي أقترحه لك
للتجربة الواقعية الأولى، استهدف تقريبًا:
| المستوى | عدد المقاطع التقريبي | مدة الكلام |
|---|---|---|
| اختبار سريع | 100–200 | 10–20 دقيقة |
| تجربة واقعية مناسبة لك | 400–800 | 45–90 دقيقة |
| جودة أعلى | 1000+ | 1–2+ ساعة |
هذه ليست أرقامًا إلزامية؛ Piper نفسه يذكر أن حتى دقائق قليلة تكفي كبداية، وأن زيادة البيانات عالية الجودة تحسن النتيجة، وهناك نقاشات من مجتمع Piper تؤكد أن جودة وكمية البيانات أهم من رفع عدد Epochs فقط
سينتج لك تلقائي في لمشروع هكذا
001.wav → metadata: 001
مرقم لصوت والكلام
أهم شيء أثناء التسجيل
لا تسجل 500 جملة دفعة واحدة. قسمها إلى جلسات، وحافظ قدر الإمكان على نفس الميكروفون والمسافة ومستوى الصوت. لا تغيّر الغرفة أو الصدى بين الجلسات، ولا تضع موسيقى أو ضوضاء خلفية. جودة التسجيل والتفريغ الصحيح لها تأثير مباشر على جودة نموذج
الشرح متعب جدا وياخذ وقتتتتتتتتتتتتتتتتتتتتتتتتتتت : سهلت عليك المهم الان ارفع في مشروعي اي صوت وينتج لك الملفين وسلام عليكم
واجهه احترافيه وسهله الاستخدام لاي شخص يبحث عن صنع اصوات خليجيه بذات وتم انشاء الخدمه لدولتي الكويت
وبالتحديد باللهجه البدويه رمز قوه ابناء الجزيره العربيه
معي اني تعبت في الخدمات الكثيره لذكاء الاصطناعي والبحث عن اصوات خليجيه
كمثال لكويت بنبره صوت مرجعي كما ينقال بالبرمجه المهم وجده اسهل الطرق الغير معقده للكثير اللى ما يعرف عالم البرمجه والخوارزمية
* البرمجه عملتها بفكرتي وتدبيري لتكون سهله جدا : بس ترفع المجلد وتضغط التثبيت يكون نفسه تلقائي *
بدل البرمجه المعقده المنتشره المتفوحه -
وخصصه التطبيق يشتغل على الويندوز 64 بت فقط
Windows 10-11
تخرج صفحه ويب index.html بكل احتراف
- كل ما صار حاسوبك قوي بالخدمات انت فوق السحاب مرتاح
مثبت بالخدمه
ينزّل تلقائيًا:
Python 3.11
Piper + training dependencies
Cython/متطلبات monotonic_align
FFmpeg
Whisper.cpp
Whisper model
Node packages
لا يعتمد على Python موجود عند المستخدم.
لا يعتمد على PATH الموجود عند المستخدم؛ يستخدم المسارات داخل المشروع، ويمكنه تعديل PATH عند الحاجة.
يعالج monotonic_align فعليًا بدل فحصه فقط. وثائق Piper الرسمية نفسها توضح أن تدريب الصوت يحتاج بناء امتداد monotonic_align بعد تثبيت
وغيرها
قبل التثبيت حجمه
32.9 MB
بسبب الصوت فقط هذا الحجم wav
HaYeF5-VoiceTrainer-onnx-json-wav
بعد التثبيت للاسف اكثر من
4.91 GB
بس يستاهل
شكل المشروع
KuwaitVoiceTrainer/
│
├── install.bat ← المستخدم يشغله مرة واحدة
├── start.bat ← المستخدم يشغله بعد التثبيت
│
├── server.js ← يبقى أساس المشروع
├── package.json ← يبقى أساس المشروع
│
├── public/
│ ├── index.html
│ ├── app.js
│ ├── style.css
│ └── ...
│
├── engine/
│ ├── ffmpeg.exe
│ ├── ffprobe.exe
│ ├── whisper-cli.exe
│ └── ggml-large-v3-turbo-q5_0.bin
│
├── runtime/
│ ├── uv.exe
│ ├── python/
│ ├── venv/
│ ├── piper/
│ └── cache/
│
├── input/
│
├── dataset/
│ ├── metadata.csv
│ └── wav/
│
├── training/
│ ├── cache/
│ ├── checkpoints/
│ ├── logs/
│ └── processed/
│
├── voices/
│ └── kw_male/
│ ├── voice.onnx
│ └── voice.onnx.json
│
└── logs/
مراحل التطبيق :
عندك سبع مراحل
1- الصوت
2- تحيل التسجيل وحاله النظام
4- مراجعه النص وتضغط انشاء
5- خروج مثل
✓ تم إنشاء Dataset بنجاح.
dataset/metadata.csv
dataset/wav/
6- تدريب نموذج الصوت بدء وتنتظر
أنت حاليًا تستخدم:
--trainer.accelerator cpu
--trainer.devices 1
--trainer.max_epochs 10000
وهذا يعني أن التدريب مجبور على المعالج CPU، وليس كرت الشاشة. و10000 Epochs رقم كبير جدًا.
هل يمكن تسريعه؟
نعم، وبشكل كبير إذا كان جهازك يملك NVIDIA GPU يدعم CUDA.
أما إذا كان التدريب على CPU فقط، فنستطيع تحسين الإعدادات، لكن لن يصبح سريعًا مثل GPU.
* واذا حبيت تسرعه فقط التعديل في train.bat
بس كل ماصار كمبيوترك خدماته عاليه لا يحتاج
7- النموذج النهائي - هو الاهم سوف يتخير اللون الاحمر الى اخضر ومبروك
خلك على المجلد KuwaitVoiceTrainer
وارفعه في الدي اذا مساحتك تكفي تنبيه :
شرح التشغيل لاول مره اضغط على install.bat
ياخذ وقت على التنزيل
وبعدها سكرها :)
والضغط على هذا لتشغيله في اي وقت start.bat
1- ارفع اي مقطع صوت wav ويسمح لاي صيغه اخره بس يفضل عزل الصوت من المسيقه
وعندك برمجه عملتها لهذا الغرض
او استخدم الخدمات اللى تتيح لك مجاني وهي محدوده
https://vocalremover.org/ar/
بعدها يخرج لك بمسار
D:\KuwaitVoiceTrainer\dataset
مجلد ويب wav وتحتها مثل
المقاطع اللى تم تقطيعه بمثال
000001
metadata.csv هنا راح تجد مثل 000001 والجمله او الاغنيه مرتب + ويمكنك التعديل
و
whisper.json
--
وعندك مجلد training يمكنك مسحه يدوي اذا تبي تسوي تطبيق اخر ويمكن تركه بس مسحه افضل
--
* D:\KuwaitVoiceTrainer\voices
صراحه شرح الخدمه معقد حنا لنا المهم في صنع : صوت معين انا مثبت ل مجلد kw_male
ويوجد مجلد kw_female
وهمنا نخرج صوت معين كرجل كويتي يتكلم بالنبره المطلوبه البداويه
راح يتكون ملفين
voice.onnx ل json
لرفعها في اي مشروح مثل اللى عملته
* اكتب نص وانتظر يحوله الى صوت
تم عمل نسخه للويندوز لانشاء onnx و jsonبرفع مقطع صوتي وتقطيعه ووضع ترجم لاي صوت برمجه هايف السفراني مجاني
-*******-
مشروع KuwaitVoice Trainer الحالي مصمم ليعمل محليًا على Windows x64، وكل خدماته داخل مجلد المشروع:
runtime\
engine\
node_modules\
dataset\
training\
voices\
input\
public\لذلك تستطيع نقل مجلد المشروع كاملًا إلى كمبيوتر Windows آخر وتشغيله هناك، لكن يجب أن يكون الجهاز مناسبًا للتدريب من حيث المعالج والذاكرة ومساحة التخزين، وقد تحتاج إعادة تشغيل install.bat على الجهاز الجديد لتجهيز الخدمات محليًا.
أما رفعه إلى استضافة ويب عادية أو cPanel فلن يعمل بهذا الشكل، لأن المشروع يعتمد على Python/Piper/Whisper/FFmpeg وتشغيل عمليات محلية طويلة.
وللنشر على جهاز آخر، لا تحتاج نقل:
node_modules\
runtime\
engine\كدائمًا؛ يمكن إعادة تجهيزها بواسطة install.bat، بينما تنقل بياناتك المهمة مثل:
dataset\
voices\
training\
input\بحسب ما تريد الاحتفاظ به.
إذا كان قصدك تشغيله على VPS أو سيرفر بعيد بدل الكمبيوتر الشخصي، فذلك ممكن أيضًا، لكن مواصفات وطريقة النشر تختلف
ملاحظات :
* لم اعمل النسخه بالشكل الاحترافي بسبب ضعف حاسوبي
- في كل عمل تسويه يمكنك تمسح مافي هذي المجلدات فقط
dataset وفي داخله الويب لصوتيات التى تم تجزئها
- وهذا logs
وهذا training
اسم النسخه
النسخه الاوله لويندوز تحويل الصوت الى كلام وتقطيعه واستخراج voice.onnx و WAV لانتاج صوت خليجي بالنبره
* سويت لكم نسخه مجانيه بلا اي تعقيد
- واجهه ويب محترفه
* سبع مراحل !
شاهد الفيديو
وتابع جديدنا




ليست هناك تعليقات: