استخراج البيانات من الويب (Web Scraping) وبيانات المنتديات: الخطوات والضوابط
Web Scraping for AI Data
الجواب المختصر
تظهر صفحة المنتج للمستخدم كتصميم عادي، لكن كودها HTML يحتوي وسومًا ثابتة (اسم، سعر، وصف) يتغير محتواها من منتج لآخر؛ لذلك البيانات غير مهيكلة من وجهة المستخدم وشبه مهيكلة من وجهة المبرمج. تمر عملية الاستخراج بخطوات: تحديد الموقع والبيانات، وفحص بنية الصفحة بأدوات المتصفح، وجلب الصفحة برمجيًا، وتحليل الكود للوصول إلى القيم، ثم تنظيف القيم وتخزينها في CSV أو JSON أو قاعدة بيانات.
الخطوات
- تحديد الموقع المستهدف ونوع البيانات (أسعار، عناوين أخبار، آراء زبائن).
- فحص بنية الصفحة بأدوات المتصفح لمعرفة أماكن البيانات داخل الوسوم أو الأصناف.
- جلب الصفحة برمجيًا بإرسال طلب والحصول على كود HTML الخام.
- تحليل الكود والبحث عن الوسوم التي تحتوي القيم المطلوبة.
- تنظيف القيم وتخزينها بصيغة منظمة (CSV أو JSON أو جدول).
مثال: صفحة تعرض مدنًا، وكل مدينة في صندوق HTML له أصناف للاسم والدولة والحرارة والرطوبة؛ يمكن لبرنامج بايثون جلب الصفحة وقراءة الأصناف وتخزين كل المدن في ملف JSON.
الضوابط القانونية والأخلاقية
- بعض المواقع تعدّ الجمع الآلي مخالفة لشروط الاستخدام؛ اقرأ سياستها.
- احترم الحد المسموح من الطلبات وملف robots.txt.
- تجنّب جمع بيانات شخصية حساسة دون حاجة أو موافقة.
- احذف ما يكشف هوية الأفراد مباشرة قبل التحليل.
المنتديات كمصدر
تعتمد المنتديات على محتوى المستخدمين: مواضيع وردود وملفات تعريف وتواريخ وبيانات وصفية (وسوم، مشاهدات، إعجابات). تفيد في فهم سلوك المستخدمين واتجاهات الحوار وتدريب نماذج فهم اللغة وتحليل المشاعر.
للتخزين والتنسيق: CSV وJSON وXML، وللمصادر عمومًا: مصادر البيانات، وللخصوصية: الخصوصية في الذكاء الاصطناعي.
المصطلحات: عربي ↔ English
- استخراج البيانات من الويب
- Web Scraping
- وسوم HTML
- HTML Tags
- ملف robots.txt
- robots.txt
لماذا يهمّ هذا في BTEC؟
المسألة ليست تقنية فقط: الجانب القانوني والأخلاقي جزء من الإجابة الجيدة.
أسئلة تجيب عنها هذه الصفحة
- ما هو Web Scraping؟
- كيف أستخرج البيانات من صفحة ويب؟
مفاهيم مرتبطة
- تنسيقات البيانات CSV وJSON وXML: المزايا والعيوب ومتى نختار كلًّا منها؟CSV أبسط تنسيق جدولي وخفيف، وJSON يمثل الهياكل المتداخلة وهو السائد في واجهات الويب، وXML واضح ومدعوم بمخططات تحقق لكنه أثقل. الاختيار يعتمد على طبيعة البيانات وحجمها ومصدرها وسهولة التكامل.
- مصادر البيانات في مشاريع الذكاء الاصطناعي: الأنظمة الداخلية والحساسات والويب والبيانات المفتوحةأبرز مصادر بيانات الذكاء الاصطناعي في المؤسسة: أنظمة المعاملات الداخلية، وأجهزة الحساسات وإنترنت الأشياء، وتفاعل المستخدمين مع التطبيقات، والمستندات والأرشيف، والبيانات المفتوحة الحكومية، والويب ومواقع التواصل.
- الخصوصية في الذكاء الاصطناعيأنظمة الذكاء الاصطناعي تتغذى على بيانات بعضها شخصي، لذلك يجب حمايتها وتوازن المؤسسات بين فائدة البيانات وحقوق الأفراد في الخصوصية.
- واجهات برمجة التطبيقات (API) وبيانات JSON: الطلب ورموز الحالة 200 و404واجهة برمجة التطبيقات نقطة دخول رسمية يطلب منها النظام بيانات محددة ويستقبل ردًا منظمًا غالبًا بصيغة JSON. يجب فحص رمز حالة HTTP قبل استخدام البيانات: 200 نجاح، 404 غير موجود، وغيرها أخطاء تُعالَج برسالة مناسبة.
عن كاتب الصفحة

مدرّس BTEC IT · الأردن
- نوع المحتوى
- شرح مبني على مادة أحمد دومي — وليس نصًّا رسميًّا من Pearson
- آخر مراجعة
- المصدر
- مدخل إلى الذكاء الاصطناعي وتطبيقاته — كتاب الوحدة (أحمد دومي) — الصفحات 15–21