Rupam.ai
All writing
تحيّز الذكاء الاصطناعيإنصاف درجات البشرة

ما الذي يظهره البحث في الواقع

التحيز في علم الأمراض الجلدية ليس جذاباً إنه اكتشاف قابل للتكرار هذا ما يقوله ذلك البحث مع المصادر

Rupam.ai14 September 20266 min read
صورة ماكرو لبشرة مظلمة مقسمة على ارتفاع في حجم البيانات الكزازية، مع إحصائيات عن البيانات الفوقية بنسبة 1.3 في المائة، مما يدل على وجود تحيز في نماذج برامج التدريب والبيانات في مجال الجلد

"AI is biased against darker skin" gets said often enough that it risks sounding like a slogan rather than a finding. It shouldn't — the underlying research is specific, peer-reviewed, and has been reproduced across multiple independent studies over the past several years.

هذا توليف لما يُظهره هذا البحث في الواقع: من أين يأتي اختلال التوازن في البيانات التدريبية، لماذا أداة التوسيم الخاصة بالميدان قد بنيت حدوداً، وما هي الفجوة في الدقة في الأرقام، وما يُقرب منها بشكل معقول. وتُعزى كل مطالبة ترد أدناه إلى مصدر معين.

اختلال التوازن في البيانات التدريبية

نقطة البداية لمعظم عارضات الأمراض الجلدية هي مجموعة بيانات للصور العامة و تلك مجموعات البيانات ليست ممثّلة لدُم البشرة في العالم A systematic review of 70 available publicly available skin-image datasets, published in The Lancet Digital Health, found that country of origin was recorded for only a fraction of images — and where it was, the images clustered heavily in a small number of Western countries. وكانت البيانات الفوقية عن طريق الجلد أو الإثنية حاضرة لما يقرب من 1.3 في المائة** من الصور عبر مجموعات البيانات المستعرضة.

وهذا أمر يتجاوز الحجة النزيهة: لا يمكن تقييم النموذج إلا على ما سجلته بياناته. ولا يمكن لأية مجموعة بيانات لم تصنف أبداً نبرة جلدية أن تنتج معياراً يفيد بأن دقة التقارير حسب نبرة الجلد - وتصبح الفجوة في العلامة فجوة في ما يمكن حتى مراجعة حساباته لاحقاً.

مقياس "فيتزباتريك" بحدوده الخاصه كآداة للصق البطاقات

Where datasets do carry a skin-tone label, that label is almost always the .Fitzpatrick. scale — a system dermatologist Thomas .Fitzpatrick. introduced in 1975 to classify UV burning and tanning response for phototherapy dosing, not skin colour. وتشير البحوث المنشورة في الطب الرقمي npj Digital Medicine التي تدرس استخدامه كمعيار لعلامات AI إلى أن فئاته الست لم تُثبت أبداً على أنها تصنيف لون، وأن نوع " فيتزباتريك " المبلَّغ عنه ذاتياً، على وجه الخصوص، غير متوافق مع انعكاسات الجلد المقيسة.

وكشفت دراسة تصنيفية أجريت في عام ٢٠٢٦ في " مجلة " الأكاديمية الأمريكية لعلم الدم* عن عدم استقرار مماثل: فالنماذج التي تم تدريبها للتنبؤ بنوع " فيتزباتريك " من الصور أظهرت اتفاقا أقل من ذي قبل مع تصنيفات أطباء الجلد في النهاية المظلمة )النوع الخامس - السادس( مما كان عليه في النهاية الأيسر - فالعلامة ذاتها هي أقل موثوقية عندما تكون السمات الدقيقة أكثر أهمية بالنسبة ل " " .

ما يُظهره البحث عن دقّة

ويتبين من الأثر اللاحق أن هناك فجوة في الحساسية يمكن قياسها في النقاط المرجعية للأدوية، وأكثرها تماسكاً في الكشف عن الإصابة بمرض الظهارة المتوسطة والنسيج. وقد وجدت التقييمات المستقلة التي تقارن الأداء النموذجي عبر تجمعات " فيتزباتريك " مراراً حساسية وخصوصية أضعف على صور " فيتزباتريك الرابع - السادس " من " فيتزباتريك " . I-II images** evaluated by the same model - the direction of the gap is consistent across studies even where the exact magnitude varies by dataset and task.

هذا ليس فريداً من نوعه لـ (ميلانوما) وقد تم توثيق نفس النمط - وهو الأداء المتدهور المرتبط بنوع أعلى من نوع " فيتزباتريك " أو نبرة جلدية مظلمة - عبر مهام أوسع نطاقاً لتصنيف صور علم الجلد، وهو ما يتسق مع شرح بيانات التدريب بدلاً من تفسير خاص بالمرض.

ما يحسنه

فالبحوث ليست تشخيصية فحسب - بل تشير أيضا إلى ما يغلق الفجوة، وهي أقل غرابة مما قد يبدو. وتُفيد الدراسات التي تُعيد تدريب أو نماذج مناظرة دقيقة على مجموعات بيانات مؤثرة بالصوت** عن تحسّن الحساسية بشأن الصور من طراز Fitzpatrick. IV-VI، في بعض الحالات، مما يُحدّد حصة مجدية من الفجوة التي تُقاس على أساس أداء النموذج نفسه. وقد أدت مسارات التحسن التي أجريت مع كيفية تمثيل البيانات المضافة في الواقع، ليس فقط حجمها - وهو كمية صغيرة من البيانات المتنوعة ذات الوسم الجيد والتي استعرضها الخبراء، إلى نقل الدقة أكثر من كمية كبيرة من البيانات غير الموثقة أو المبلّغ عنها ذاتيا في العديد من هذه التقييمات.

  • بيانات تدريبية تمثيلية، لا بيانات إضافية فحسب. الفول وحده لا يغلق الثغرة عدة دراسات تظهر مجموعة بيانات مختلفة أصغر حجماً
  • ملصقات مستعرضة من الخبراء على نوع " فيتزباتريك " المبلغ عنه ذاتيا. ويستحدث نوع الجلد المبلَّغ عنه ذاتياً نفس عدم الاستقرار الموثق في الدراسة التي أُجريت في إطار التصنيف الذي أجرته الوكالة اليابانية للتنمية الزراعية (JAAD) أعلاه؛ والعلامات المصنّفة من علم الجلد أو المقيّمة بمليارات الألوان أكثر موثوقية.
  • يُحدِّد التقييم أن البوابة تُطلق بالنبرة، لذا لا يمكن للنموذج أن يُركب بفارق غير مُكتشف على . فيتزباتريك الرابع - السادس لمجرد أن الدقة الإجمالية تبدو مقبولة.

ما يعنيه هذا بالنسبة لقرار المنتج، ليس مجرد موجز بحثي

وبالنسبة لعلامة تجارية أو مشتر يقيّم بائعاً يعمل لحساب الجلد، فإن البحث الوارد أعلاه يتحول إلى سؤال مختصر وملموس: هل هذا النموذج قد درّب وقيّم على مجموعة بيانات تصنف بالفعل وتمثّل Fitzpatrick? III-VI skin, or was that label largely absent from the data it learned from?؟ بائع يمكنه أن يجيب بإنهيار دقته يصف نموذجاً بني بالطريقة التي يقول بها البحث يغلق الفجوة بائع لا يستطيع، وفقاً للدراسات الواردة أعلاه يصف نموذجاً على الأرجح لم يختبر ضد السؤال

وهذه هي نفس الآلية الأساسية التي تغطيها زاوية السوق الهندية في جزئنا عن لماذا لا تزال فيتزباتريك الثالث - السادس تعامل على أنها حالة حافة في معظم الجلد AI - التي تنطبق عليها هذه المادة البحث أدناه على ما تكلّف عليه سمة جمال D2C تحديداً؛ ويبقى هذا البحث في حد ذاته.

المصادر

الاستشهاد الكامل لكل مطالبة أعلاه، بالنسبة لأي شخص يرغب في التحقق من ذلك أو البناء عليه مباشرة:

  • Review of 70 publicly available skin-image datasets — The Lancet Digital Health*, 2022.
  • امتحان مقياس " فيتزباتريك " كمعيار لعلامات AI، بما في ذلك الإبلاغ الذاتي ضد التجليات المقيسة - الطب الرقمي
  • .Fitzpatrick.-type classifier agreement study, showing lower dermatologist-agreement at darker skin types — Journal of the American Academy of Dermatology, 2026.
  • .Fitzpatrick., T.B. — The validity and practicality of sun-reactive skin types I through VI, Archives of Dermatology, 1988.

Frequently asked

هل التحيز في علم الجلد مشكلة حقيقية موثقة؟
نعم الدراسات المتعددة المستقلة التي استعرضها النظراء - بما في ذلك إجراء استعراض منهجي لـ 70 من مجموعات البيانات العامة المتعلقة بإصابة البشرة في البحوث المتعلقة بالصحة الرقمية والمصنفة في مجلة الأكاديمية الأمريكية لطب الأمراض - وتوثيق ثغرة حادة في بطاقات تعريف البشرة في بيانات التدريب، وثغرة مستمرة في الدقة بين أنواع أخف وأظلم من نوع " فيتزباتريك " التي تنتج عنها نماذج.
لمَ تؤدي عارضات الأمراض الجلديّة أسوأ على عظام الجلد المظلمة؟
في المقام الأول، لأن البيانات العامة معظم النماذج يتم تدريبها على حمل بطاقات لقطعة صغيرة من الصور والمجموعة بشكل كبير نحو حفنة من البلدان الغربية ومقارنة بذلك، تم بناء مقياس " فيتزباتريك " معظم استخدام مجموعات البيانات لتصنيف الأشعة فوق البنفسجية، وليس لون البشرة، وتوثيق أن يكون أقل موثوقية في الطرف المظلم من الجدول - حيث يكتسي وضع العلامات بدقة أكبر.
ما الذي يُحسّن في الواقع دقّة الجلد في الجلد المظلم؟
وتشير البحوث إلى بيانات عن التدريب التمثيلي المتعمد، التي جرى تقييمها بعلامات من النوع الذي يخضع لاستعراض الخبراء بدلاً من التبليغ عن نفسه، وإطلاقها على أساس الدقة الواحدة بدلاً من تقييمها الكلي. وتشير الدراسات المتعلقة بنماذج إعادة التدريب على البيانات المتنوعة والمصاغة بشكل جيد إلى حدوث تحسينات ذات مغزى في الحساسية على صور " فيتزباتريك الرابع - السادس " ، وتتبعات المكاسب التي تكتنف كيفية تمثيل البيانات المضافة، وليس مجرد مقدارها.

Sources

  1. استعراض منهجي لمجموعات البيانات المتاحة علناً عن تقدير الجلد — The Lancet Digital Health, 2022
  2. The .Fitzpatrick. scale as an AI labelling standard — self-report vs measured reflectance — الطب الرقمي, 2023
  3. Fitzpatrick- نوع اتفاق التصنيف عبر أنواع الجلد — Journal of the American Academy of Dermatology, 2026
  4. .Fitzpatrick., T.B. — صحة وطابع الجلد التفاعلي للشمس من الأول إلى السادس — محفوظات علم الدم, 1988

انظر كيف نقيم هذه الفجوة المحددة

ومنهجيتنا المعيارية للمرحلة الواحدة، والنتائج الحالية، والقيود التي لم نحلها بعد - المنشورة بدلا من الموجز.

انظر تقرير الدقة