تجهيز البيانات لنماذج الذكاء الاصطناعي: اختيار السجلات وتقليل البيانات والميزات والتطبيع
Preparing Data for AI Models
الجواب المختصر
عند اختيار بيانات التدريب نسأل: هل تمثل الواقع الذي سيعمل فيه النموذج؟ وهل جمعها واستخدامها يحترم حقوق أصحابها؟ بعدها تأتي مرحلة التجهيز: فحص القيم المفقودة وأسبابها (خلل جمع أم معلومة غير مطلوبة؟) وقرار التعويض بالمتوسط أو الوسيط أو الحذف، واكتشاف التكرارات التي تعطي وزنًا مضاعفًا لحالات، وتحويل القيم الخام إلى ميزات أوضح (اليوم والساعة والفصل بدل تاريخ الشراء، والمدينة ونوع المنطقة بدل العنوان النصي)، وتطبيع القيم الرقمية حتى لا يطغى متغير ذو قيم كبيرة على آخر.
خطوات التجهيز
- اختيار سجلات تمثل الواقع، وتجنب جمع معلومات شخصية لا حاجة لها (مثل اسم الطالب الكامل أو هاتفه إن كان النموذج يحتاج فقط نوع المدرسة والمنطقة والدرجات).
- فحص القيم المفقودة وأسبابها وتقرير التعويض أو الحذف.
- اكتشاف التكرارات.
- تحويل القيم الخام إلى ميزات أقرب إلى المشكلة.
- تطبيع الأرقام: دخل سنوي بالدنانير مع درجة من 1 إلى 5 قد يحتاج إعادة تحجيم.
- مراجعة منطقية الحقول: النوع، ترتيب التواريخ، أعمار خارج الحدود البشرية، قيم سالبة غير منطقية، ثم مراجعة التوزيع.
وتقليل البيانات مبدأ أخلاقي وتقني معًا. انظر خطوات تنظيف البيانات والقيم المفقودة وتقسيم البيانات ومبادئ الجمع.
وختامًا وثّق كل خطوة تجهيز؛ فالقرارات التي تتخذها هنا (حذف أو تعويض أو تحويل) تؤثر في قرارات النموذج لاحقًا.
المصطلحات: عربي ↔ English
- ميزة
- Feature
- تطبيع
- Normalisation
- تقليل البيانات
- Data Minimisation
- هندسة الميزات
- Feature Engineering
لماذا يهمّ هذا في BTEC؟
هذه المرحلة تحدد جودة النموذج أكثر مما يتصور كثيرون؛ والخطأ فيها غالبًا لا يظهر إلا بعد النشر.
أسئلة تجيب عنها هذه الصفحة
- كيف أجهّز البيانات لنموذج ذكاء اصطناعي؟
- ما هو تطبيع البيانات؟
مفاهيم مرتبطة
- خطوات تنظيف ومعالجة البيانات: من البيانات الخام إلى بيانات جاهزةمعالجة البيانات سلسلة عمليات على البيانات الخام لتنظيمها وتصحيحها: توحيد كتابة الأسماء والتواريخ والهواتف، وتصحيح الأخطاء، وإزالة المكرر، وترتيبها في صفوف وأعمدة، والتأكد من اكتمال الحقول المهمة.
- تنظيف السلسلة الزمنية ومعالجة القيم المفقودة: الحذف أم التعويض؟عند ظهور قيم مفقودة (NA) في سلسلة زمنية يمكن حذف الصفوف أو تعويضها: بمتوسط الساعة نفسها عبر الأيام أو بآخر قيمة معروفة (LOCF). لكل طريقة أثر مختلف في شكل البيانات، لذلك تُجرَّب أكثر من طريقة ويُقارَن أثرها.
- مجموعات التدريب والتحقق والاختبار: كيف نقسّم البيانات ولماذا؟نقسّم البيانات إلى تدريب (يتعلم منها النموذج)، وتحقق (لضبط الإعدادات واختيار البنية)، واختبار (تُحفظ بعيدًا لقياس الأداء الحقيقي بعد التدريب). ويجب أن تحافظ المجموعات على نسب الفئات نفسها، وأن يُعزل الاختبار فلا تتلوث بيانات الاختبار.
- مبادئ جمع بيانات الذكاء الاصطناعي وتجهيزها: خمسة مبادئ أساسيةخمسة مبادئ: فهم المتطلبات قبل الجمع، والتأكد من دقة البيانات ونزاهتها ومصدرها القانوني، والحد من التحيز وضمان التنوع، وتنظيف البيانات وتجهيزها فنيًا، واحترام الأخلاقيات والقوانين وإخفاء المعلومات الشخصية.
- دورة تطوير مشروع ذكاء اصطناعي: من تحديد المشكلة إلى النشر والمراقبةمشروع الذكاء الاصطناعي ليس كودًا فقط، بل دورة تتكرر: تحديد المشكلة، جمع البيانات، تحضيرها وتنظيفها، اختيار النموذج وتجربة أكثر من حل، تقييم النتائج وتحسينها، ثم نشر النموذج ومراقبته والعودة للتحسين.
- كيف نختار مصادر بيانات مناسبة وموثوقة لمشروع الذكاء الاصطناعي؟نبدأ بتحديد هدف المشروع، ثم نراجع ما تملكه المؤسسة داخليًا قبل شراء بيانات خارجية، ثم نقيّم المصدر بمعايير: الحداثة، والاكتمال، والدقة، والتغطية، والجوانب القانونية والأخلاقية، والكلفة، ثم نجرّب بتجربة صغيرة قبل الاستثمار الكبير.
عن كاتب الصفحة

مدرّس BTEC IT · الأردن
- نوع المحتوى
- شرح مبني على مادة أحمد دومي — وليس نصًّا رسميًّا من Pearson
- آخر مراجعة
- المصدر
- مدخل إلى الذكاء الاصطناعي وتطبيقاته — كتاب الوحدة (أحمد دومي) — الصفحات 87–88