<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>تحليل البيانات on kenji.blog</title><link>http://kenji.blog/ar/tags/%D8%AA%D8%AD%D9%84%D9%8A%D9%84-%D8%A7%D9%84%D8%A8%D9%8A%D8%A7%D9%86%D8%A7%D8%AA/</link><description>Recent content in تحليل البيانات on kenji.blog</description><generator>Hugo -- gohugo.io</generator><language>ar</language><copyright>kenjinote</copyright><lastBuildDate>Thu, 10 Sep 2026 07:00:00 +0900</lastBuildDate><atom:link href="http://kenji.blog/ar/tags/%D8%AA%D8%AD%D9%84%D9%8A%D9%84-%D8%A7%D9%84%D8%A8%D9%8A%D8%A7%D9%86%D8%A7%D8%AA/index.xml" rel="self" type="application/rss+xml"/><item><title>مفارقة سيمبسون: ظاهرة غامضة حيث تفوز في الأجزاء، لكنك تخسر في المجمل</title><link>http://kenji.blog/ar/p/simpsons-paradox/</link><pubDate>Thu, 10 Sep 2026 07:00:00 +0900</pubDate><guid>http://kenji.blog/ar/p/simpsons-paradox/</guid><description>&lt;img src="http://kenji.blog/p/simpsons-paradox/img/simpsons_paradox.jpg" alt="Featured image of post مفارقة سيمبسون: ظاهرة غامضة حيث تفوز في الأجزاء، لكنك تخسر في المجمل" />&lt;h2 id="1-في-أي-مستشفى-يجب-أن-تخضع-للجراحة">1. في أي مستشفى يجب أن تخضع للجراحة؟
&lt;/h2>&lt;p>لقد أُصبت بمرض خطير وعليك الخضوع لعملية جراحية.
أمامك خياران: مستشفى A ومستشفى B. لقد طلبت بيانات &amp;ldquo;معدل النجاح&amp;rdquo; للعمليات الجراحية في كل مستشفى.&lt;/p>
&lt;p>&lt;strong>【معدل النجاح الإجمالي】&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>مستشفى A&lt;/strong>: 900 نجاح من أصل 1000 شخص (معدل النجاح &lt;strong>90%&lt;/strong>)&lt;/li>
&lt;li>&lt;strong>مستشفى B&lt;/strong>: 800 نجاح من أصل 1000 شخص (معدل النجاح &lt;strong>80%&lt;/strong>)&lt;/li>
&lt;/ul>
&lt;p>عند رؤية هذا، سيعتقد أي شخص أن &amp;ldquo;مستشفى A هو الأفضل!&amp;rdquo;.
ولكن، بما أنك شخص حذر، قررت التحقيق بشكل أعمق لمعرفة كيف تتغير البيانات بناءً على حالة المرض (خفيفة أم شديدة).&lt;/p>
&lt;p>&lt;strong>【معدل نجاح المرضى ذوي الحالات الخفيفة】&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>مستشفى A&lt;/strong>: 99 نجاحاً من أصل 100 شخص (معدل النجاح &lt;strong>99%&lt;/strong>)&lt;/li>
&lt;li>&lt;strong>مستشفى B&lt;/strong>: 870 نجاحاً من أصل 900 شخص (معدل النجاح &lt;strong>96%&lt;/strong>)
$\rightarrow$ في الحالات الخفيفة، &lt;strong>يفوز مستشفى A (99% &amp;gt; 96%)&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>&lt;strong>【معدل نجاح المرضى ذوي الحالات الشديدة】&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>مستشفى A&lt;/strong>: 801 نجاحاً من أصل 900 شخص (معدل النجاح &lt;strong>89%&lt;/strong>)&lt;/li>
&lt;li>&lt;strong>مستشفى B&lt;/strong>: 70 نجاحاً من أصل 100 شخص (معدل النجاح &lt;strong>70%&lt;/strong>)
$\rightarrow$ حتى في الحالات الشديدة، &lt;strong>يفوز مستشفى A (89% &amp;gt; 70%)&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>مهلاً؟ ألا تعتقد أن هناك شيئاً غريباً؟&lt;/p>
&lt;p>بالنسبة للمرضى ذوي الحالات &amp;ldquo;الخفيفة&amp;rdquo;، معدل نجاح مستشفى A أعلى.
وبالنسبة للمرضى ذوي الحالات &amp;ldquo;الشديدة&amp;rdquo;، معدل نجاح مستشفى A أعلى أيضاً.
ومع ذلك، إذا حسبنا &amp;ldquo;الإجمالي&amp;rdquo; لمعدل نجاح جميع المرضى معاً&amp;hellip;؟&lt;/p>
&lt;ul>
&lt;li>إجمالي مستشفى A: $(99 + 801) / 1000 =$ &lt;strong>90%&lt;/strong>&lt;/li>
&lt;li>إجمالي مستشفى B: $(870 + 70) / 1000 =$ &lt;strong>94%&lt;/strong>&amp;hellip; لا، وفقاً للحسابات السابقة فهو &lt;strong>80%؟&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>انتظر لحظة، دعنا نلقي نظرة على البيانات الأولى مرة أخرى.
البيانات الأولى كانت هكذا:&lt;/p>
&lt;ul>
&lt;li>معدل النجاح الإجمالي لمستشفى A: &lt;strong>90%&lt;/strong>&lt;/li>
&lt;li>معدل النجاح الإجمالي لمستشفى B: &lt;strong>80%&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>ولكن، إذا أعدنا الحساب باستخدام البيانات المقسمة تفصيلياً،
فإن معدل النجاح الإجمالي لمستشفى B يجب أن يكون $(870 + 70) / 1000 = 940 / 1000 =$ &lt;strong>94%&lt;/strong>.&lt;/p>
&lt;p>&lt;strong>&amp;hellip; حسنًا، لقد تم خداعنا!&lt;/strong>
في الواقع، خدعة الأرقام هذه هي بالضبط الفخ المرعب للإحصاءات الذي سنشرحه هذه المرة.
دعني أريك البيانات الصحيحة مرة أخرى.&lt;/p>
&lt;hr>
&lt;h2 id="2-إليك-أيها-المخدوع-البيانات-الحقيقية">2. إليك أيها المخدوع: البيانات الحقيقية
&lt;/h2>&lt;p>&lt;strong>【معدل نجاح المرضى ذوي الحالات الخفيفة】&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>مستشفى A&lt;/strong>: 870 نجاحاً من أصل 900 شخص (معدل النجاح &lt;strong>96%&lt;/strong>)&lt;/li>
&lt;li>&lt;strong>مستشفى B&lt;/strong>: 99 نجاحاً من أصل 100 شخص (معدل النجاح &lt;strong>99%&lt;/strong>)
$\rightarrow$ في الحالات الخفيفة، &lt;strong>يفوز مستشفى B (99% &amp;gt; 96%)&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>&lt;strong>【معدل نجاح المرضى ذوي الحالات الشديدة】&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>مستشفى A&lt;/strong>: 30 نجاحاً من أصل 100 شخص (معدل النجاح &lt;strong>30%&lt;/strong>)&lt;/li>
&lt;li>&lt;strong>مستشفى B&lt;/strong>: 315 نجاحاً من أصل 900 شخص (معدل النجاح &lt;strong>35%&lt;/strong>)
$\rightarrow$ حتى في الحالات الشديدة، &lt;strong>يفوز مستشفى B (35% &amp;gt; 30%)&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>بمعنى آخر، سواء كانت الحالة خفيفة أو شديدة، &lt;strong>فإن مستشفى B يتفوق بشكل ساحق&lt;/strong>.&lt;/p>
&lt;p>إذن، دعنا نجمع هذا في &amp;ldquo;الإجمالي&amp;rdquo;.&lt;/p>
&lt;ul>
&lt;li>&lt;strong>إجمالي مستشفى A&lt;/strong>: $(870 + 30) / (900 + 100) = 900 / 1000 =$ &lt;strong>معدل النجاح 90%&lt;/strong>&lt;/li>
&lt;li>&lt;strong>إجمالي مستشفى B&lt;/strong>: $(99 + 315) / (100 + 900) = 414 / 1000 =$ &lt;strong>معدل النجاح 41%&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>يا للعجب، عندما ننظر إلى &amp;ldquo;الأجزاء&amp;rdquo; يفوز مستشفى B في كل شيء، ولكن عندما نجمعها في &amp;ldquo;الإجمالي&amp;rdquo;، يصبح الفوز الساحق لمستشفى A!
هذه الظاهرة تسمى &lt;strong>&amp;ldquo;مفارقة سيمبسون&amp;rdquo;&lt;/strong>.&lt;/p>
&lt;div class="mermaid">graph TD
subgraph "بيانات جزئية (فوز B)"
Light["حالة خفيفة: فوز مستشفى B (99% > 96%)"]
Heavy["حالة شديدة: فوز مستشفى B (35% > 30%)"]
end
subgraph "بيانات إجمالية (فوز A)"
Total["المجموع الكلي: فوز ساحق لمستشفى A (90% > 41%)"]
end
Light -->|ينعكس الأمر بشكل غريب عند الجمع| Total
Heavy -->|ينعكس الأمر بشكل غريب عند الجمع| Total
style Total fill:#ff9999,stroke:#333,stroke-width:2px&lt;/div>
&lt;hr>
&lt;h2 id="3-لماذا-يحدث-هذا-الانعكاس-الغريب">3. لماذا يحدث هذا الانعكاس الغريب؟
&lt;/h2>&lt;p>السر وراء هذه المفارقة يكمن في &lt;strong>&amp;ldquo;انحياز المعلمات (المقام)&amp;rdquo;&lt;/strong> و &lt;strong>&amp;ldquo;المتغيرات الخفية (العوامل المربكة)&amp;rdquo;&lt;/strong>.&lt;/p>
&lt;p>انظر عن كثب إلى البيانات.&lt;/p>
&lt;ul>
&lt;li>مستشفى A يقبل &lt;strong>عدداً كبيراً (900 شخص) من &amp;ldquo;المرضى ذوي الحالات الخفيفة الذين يسهل شفاؤهم&amp;rdquo;&lt;/strong>.&lt;/li>
&lt;li>مستشفى B يقبل &lt;strong>عدداً كبيراً (900 شخص) من &amp;ldquo;المرضى ذوي الحالات الشديدة الذين يصعب شفاؤهم&amp;rdquo;&lt;/strong>.&lt;/li>
&lt;/ul>
&lt;p>نظراً لمهارة أطباء مستشفى B، فقد كان أشبه بـ &amp;ldquo;الملاذ الأخير&amp;rdquo;، حيث يستقبل العديد من المرضى ذوي الحالات الشديدة والمعقدة الذين ترفضهم المستشفيات الأخرى. بطبيعة الحال، سيكون معدل نجاح الحالات الشديدة منخفضاً (35%). &amp;ldquo;معدل النجاح الإجمالي&amp;rdquo; لمستشفى B تأثر سلبًا بهذا العدد الكبير من الحالات الشديدة ذات معدلات النجاح المنخفضة، مما جعله يبدو منخفضاً بشكل عام (41%).&lt;/p>
&lt;p>على العكس من ذلك، يتعامل مستشفى A في الغالب مع الحالات الخفيفة البسيطة، لذلك بدا معدل نجاحه الإجمالي مرتفعاً (90%) فقط بسبب ذلك، ولكن عند المقارنة تحت نفس الظروف (حالات شديدة مقابل شديدة، وخفيفة مقابل خفيفة)، فإن مهاراته أقل من مستشفى B.&lt;/p>
&lt;p>إذا تم التعبير عنها رياضياً، فإن السبب هو طبيعة جمع الكسور.
بشكل عام، حتى لو كان $\frac{a}{b} &lt; \frac{A}{B}$ و $\frac{c}{d} &lt; \frac{C}{D}$، فإن
&lt;/p>
$$ \frac{a+c}{b+d} &lt; \frac{A+C}{B+D} $$
&lt;p>
لا يتحقق دائماً. عندما تكون أحجام المقامات مختلفة بشكل كبير، قد ينعكس اتجاه المتباينة.&lt;/p>
&lt;hr>
&lt;h2 id="4-مفارقة-سيمبسون-في-العالم-الحقيقي">4. &amp;ldquo;مفارقة سيمبسون&amp;rdquo; في العالم الحقيقي
&lt;/h2>&lt;p>هذه المفارقة ليست مجرد لغز حسابي، بل إنها تحدث بشكل متكرر في المجتمع الحقيقي، وقد أثارت جدلاً واسعاً في الماضي.&lt;/p>
&lt;h3 id="عام-1973-شبهات-التمييز-الجنسي-في-جامعة-كاليفورنيا-بيركلي">عام 1973: شبهات التمييز الجنسي في جامعة كاليفورنيا، بيركلي
&lt;/h3>&lt;p>عندما تم فحص معدلات القبول في برامج الدراسات العليا بجامعة بيركلي، وُجد أن &amp;ldquo;معدل قبول الذكور (44%)&amp;rdquo; كان أعلى بكثير من &amp;ldquo;معدل قبول الإناث (35%)&amp;quot;، مما أثار مشكلة حول وجود تمييز واضح ضد النساء.
ولكن، عندما تم تقسيم البيانات إلى أجزاء صغيرة &amp;ldquo;حسب القسم&amp;rdquo; وتحليلها، تم اكتشاف حقيقة مذهلة.
في كل الأقسام تقريباً، &lt;strong>كان معدل قبول الإناث أعلى من معدل قبول الذكور&lt;/strong>.&lt;/p>
&lt;p>لماذا انعكست الأرقام الإجمالية؟
في الواقع، كانت الإناث يتقدمن بشكل أكبر إلى &amp;ldquo;الأقسام ذات معدلات القبول المنخفضة (ذات التنافسية العالية)&amp;quot;، بينما كان الذكور يتقدمون بشكل أكبر إلى &amp;ldquo;الأقسام ذات معدلات القبول المرتفعة (التي يسهل دخولها)&amp;rdquo; فقط.&lt;/p>
&lt;h3 id="بيانات-فعالية-لقاح-كورونا">بيانات فعالية لقاح كورونا
&lt;/h3>&lt;p>انتشرت بيانات تشير إلى أن &amp;ldquo;معدل الوفيات بين الأشخاص الذين تلقوا اللقاح أعلى من أولئك الذين لم يتلقوه&amp;rdquo;، مما أحدث ضجة.
هذا أيضاً نتيجة لتجاهل البيانات حسب الفئة العمرية (متغير خفي).
نظراً لأن اللقاح تم إعطاؤه للأولوية لـ &amp;ldquo;كبار السن (الذين لديهم بالفعل معدل وفيات أعلى)&amp;quot;، فعند جمع معدل الوفيات الإجمالي ببساطة، كانت مجموعة الأشخاص الذين تلقوا اللقاح منحازة بشكل كبير نحو كبار السن، مما جعل معدل الوفيات يبدو أعلى ظاهرياً.&lt;/p>
&lt;p>عند المقارنة بعد التقسيم حسب الفئة العمرية، تم التأكيد على أنه في جميع الفئات العمرية &amp;ldquo;كان معدل الوفيات للأشخاص الذين تلقوا اللقاح أقل&amp;rdquo;.&lt;/p>
&lt;hr>
&lt;h2 id="5-الخلاصة-البيانات-لا-تكذب-لكن-الناس-يمكنهم-الكذب-باستخدام-البيانات">5. الخلاصة: البيانات لا تكذب، لكن الناس يمكنهم الكذب باستخدام البيانات
&lt;/h2>&lt;p>تحذرنا مفارقة سيمبسون من &lt;strong>&amp;ldquo;خطر اتخاذ القرارات بناءً على البيانات الإجمالية فقط مثل المتوسطات أو الإجماليات&amp;rdquo;&lt;/strong>.&lt;/p>
&lt;p>يمتلئ العالم بالشركات والسياسيين ووسائل الإعلام التي تقتطع &amp;ldquo;الأرقام الإجمالية&amp;rdquo; فقط للترويج لأنفسهم بطريقة تناسبهم.
حتى لو قيل لك &amp;ldquo;منتجنا A لديه مستوى رضا إجمالي أعلى من منتج الشركة المنافسة B!&amp;quot;، فربما إذا قمت بتقسيم البيانات إلى &amp;ldquo;فئة الشباب&amp;rdquo; و &amp;ldquo;فئة كبار السن&amp;rdquo;، ستجد أن منتج الشركة المنافسة B يتفوق في كلا الفئتين.&lt;/p>
&lt;p>عند النظر إلى البيانات، فإن امتلاك عين تشكك ولا تنخدع بالأرقام &amp;ldquo;الإجمالية&amp;rdquo; السطحية، وتتساءل &amp;ldquo;هل هناك انحياز شديد في نسب المجموعات بسبب المتغيرات المخفية وراء الكواليس (العمر، الجنس، شدة المرض، إلخ)؟&amp;quot;، هو أقوى سلاح للنجاة في مجتمع المعلومات الحديث.&lt;/p></description></item></channel></rss>