هل سبق لك أن انتبهت إلى “الرقم الأول” (الرقم الأكثر أهمية) للبيانات الرقمية المختلفة من حولك؟
على سبيل المثال، إذا أخذت الرقم الأول من بيانات متنوعة في الطبيعة والمجتمع، مثل تعداد سكان البلدان أو المدن، أو أطوال الأنهار، أو إيرادات الشركات، أو الثوابت الفيزيائية، فستكتشف حقيقة مذهلة: وهي أنها لا تظهر بالتساوي من 1 إلى 9، بل إن أرقاماً معينة تظهر بانحياز قوي.
الرقم الذي يظهر بشكل متكرر بينها هو “1”. من المثير للدهشة أن حوالي 30% من جميع البيانات تبدأ بالرقم 1. حدسياً، قد نتوقع أن تظهر الأرقام من 1 إلى 9 كل منها في حوالي 11.1% من الوقت، لكن بيانات العالم الحقيقي لا تعمل بهذه الطريقة.
القانون الرياضي الذي يفسر هذه الظاهرة الغامضة هو قانون بنفورد (Benford’s Law).
في هذه المقالة، سنشرح بالتفصيل كيف يعمل قانون بنفورد، ولماذا تحدث هذه الظاهرة، وكيف يتم تطبيق هذا القانون لاكتشاف الاحتيال.
ما هو قانون بنفورد؟
ينص قانون بنفورد (المعروف أيضاً باسم قانون الرقم الأول) على أنه في العديد من مجموعات البيانات الرقمية الواقعية، يكون احتمال ظهور الرقم الأول (الرقم غير الصفر الأكثر أهمية) أعلى للأرقام الأصغر.
على وجه التحديد، يتم التعبير عن الاحتمال $P(d)$ بأن الرقم الأول هو $d$ ($d \in \{1, 2, ..., 9\}$) بواسطة المعادلة اللوغاريتمية التالية:
$$ P(d) = \log_{10} \left( 1 + \frac{1}{d} \right) $$عند حساب هذه الصيغة، يكون احتمال ظهور كل رقم كرقم أول كما يلي:
- 1 : حوالي 30.1%
- 2 : حوالي 17.6%
- 3 : حوالي 12.5%
- 4 : حوالي 9.7%
- 5 : حوالي 7.9%
- 6 : حوالي 6.7%
- 7 : حوالي 5.8%
- 8 : حوالي 5.1%
- 9 : حوالي 4.6%
الأرقام التي تبدأ بـ 1 شائعة بشكل ساحق، في حين أن الأرقام التي تبدأ بـ 9 تظهر أقل من سدس عدد مرات ظهور الرقم 1.
تاريخ الاكتشاف
تمت ملاحظة هذا القانون لأول مرة في عام 1881 من قبل عالم الفلك سيمون نيوكومب. واكتشف أن الصفحات الأولى من جداول اللوغاريتمات (الصفحات التي تبدأ بـ 1 أو 2) كانت مهترئة وقذرة من الاستخدام أكثر بكثير من الصفحات اللاحقة.
في وقت لاحق، في عام 1938، حلل الفيزيائي فرانك بنفورد أكثر من 20000 مجموعة بيانات متنوعة (مساحات الأنهار، الثوابت الفيزيائية، عناوين المجلات، وما إلى ذلك) وأثبت أن هذه الظاهرة عالمية.
لماذا الرقم “1” شائع جداً؟
لماذا يحدث هذا الانحياز غير البديهي؟ التفسيرات البديهية لفهم هذا السبب هي ثبات المقياس (Scale Invariance) و التوحيد على مقياس لوغاريتمي.
ثبات المقياس
إذا كان هناك قانون طبيعي عالمي موجود، فلا ينبغي أن يتغير القانون نفسه حتى لو تغيرت وحدة القياس. على سبيل المثال، سواء تم قياس المسافة بالكيلومترات أو الأميال، يجب أن يكون التوزيع الاحتمالي للرقم الأول هو نفسه. رياضياً، عند البحث عن توزيع احتمالي يفي بشرط بقاء التوزيع دون تغيير حتى عند ضربه في ثابت (ثبات المقياس)، يصل المرء حتماً إلى التوزيع اللوغاريتمي لقانون بنفورد.
المقياس اللوغاريتمي والنمو
تنمو العديد من الظواهر الطبيعية والبيانات الاقتصادية عن طريق الضرب (الفائدة المركبة) بدلاً من الجمع. على سبيل المثال، لنفترض أن إيرادات شركة تنمو بنسبة 10٪ كل عام.
يستغرق الأمر حوالي 7.3 سنوات حتى تنمو الإيرادات من 1 مليون إلى 2 مليون (الفترة التي يكون فيها الرقم الأول هو 1). ومع ذلك، يستغرق الأمر 1.9 سنة فقط حتى تنمو الإيرادات من 5 ملايين إلى 6 ملايين (الفترة التي يكون فيها الرقم الأول هو 5). علاوة على ذلك، يستغرق الأمر 1.1 سنة فقط للنمو من 9 ملايين إلى 10 ملايين (الفترة التي يكون فيها الرقم الأول هو 9).
بمجرد أن يصل إلى 10 ملايين، يعود الرقم الأول إلى 1، وسيقضي وقتاً طويلاً حتى يصل إلى 20 مليوناً. بعبارة أخرى، في البيانات التي تنمو بشكل كبير، فإن الفترة التي يكون فيها الرقم الأول عبارة عن رقم صغير أطول بشكل ساحق.
$$ \text{وقت البقاء} \propto \log_{10}(d+1) - \log_{10}(d) $$ما نوع البيانات التي ينطبق عليها؟
لا يمكن تطبيق قانون بنفورد على جميع البيانات. هناك فرق واضح بين البيانات التي ينطبق عليها والبيانات التي لا ينطبق عليها.
أمثلة على البيانات القابلة للتطبيق
- البيانات الموزعة على نطاق واسع: البيانات التي تمتد عبر عدة أوامر من الحجم (مثل: البيانات الموزعة من 10 إلى 1،000،000).
- البيانات التي تم إنشاؤها بشكل طبيعي: أطوال الأنهار، ومساحات البحيرات، والثوابت الفيزيائية، والكتلة الجزيئية، وما إلى ذلك.
- البيانات المتعلقة بالبشر: أسعار الأسهم، وإيرادات الشركات، والإقرارات الضريبية، والسكان، وما إلى ذلك.
أمثلة على البيانات غير القابلة للتطبيق
- الأرقام المخصصة بشكل مصطنع: أرقام الهواتف، والرموز البريدية، وأرقام الضمان الاجتماعي، وما إلى ذلك.
- بيانات ذات نطاق محدود: الطول البشري (يقع معظمه بين 100 سم و 200 سم، مما يجعل الأرقام التي تبدأ بـ 1 هي الأغلبية الساحقة).
- البيانات الموزعة بشكل طبيعي: البيانات المتركزة حول متوسط، مثل درجات الاختبار أو معدل الذكاء.
التطبيق في اكتشاف الاحتيال
حالياً، تعد اكتشاف الاحتيال (Fraud Detection) واحدة من المجالات التي يستخدم فيها قانون بنفورد بشكل عملي.
عندما يحاول البشر اختلاق أو التلاعب بالأرقام عشوائياً لإنشاء بيانات، فإنهم يحاولون دون وعي استخدام كل رقم بشكل متساوٍ أو تجنب أرقام معينة. ومع ذلك، نظراً لأن البيانات الطبيعية تتبع قانون بنفورد، فإن البيانات المختلقة ستنحرف بشكل كبير عن هذا القانون.
الاستخدام في عمليات التدقيق المحاسبي
تقوم السلطات الضريبية وشركات التدقيق المحاسبي بمسح دفاتر الشركات وتقارير النفقات للتحقق تلقائياً مما إذا كان الرقم الأول (أو الرقم الثاني) من الأرقام يتبع قانون بنفورد.
graph TD
A["جمع البيانات"] --> B["استخراج الأرقام الأولى"]
B --> C{"المقارنة مع قانون بنفورد"}
C -->|"تطابق"| D["طبيعي (لا يوجد احتيال)"]
C -->|"انحراف كبير"| E["وضع علامة كبيانات مشبوهة"]
E --> F["إجراء تدقيق مفصل"]
إذا تم تضخيم كمية كبيرة من “النفقات الوهمية”، فإن توزيع هذه المبالغ سيصبح غير طبيعي وسيبرز من منحنى قانون بنفورد. هذه الطريقة قوية بشكل لا يصدق، وفي الواقع، تم الكشف عن العديد من حالات الاختلاس والاحتيال المحاسبي التي أثارها هذا القانون.
ادعاءات تزوير الانتخابات
أيضاً، في بيانات فرز أصوات الانتخابات، يُستخدم ما إذا كانت النتائج المجمعة لكل مركز اقتراع تتبع قانون بنفورد أحياناً كمؤشر للتحقق من تزوير الانتخابات (مع ذلك، في حالة بيانات الانتخابات، يكون من الصعب أحياناً تطبيقها اعتماداً على حجم الدوائر، وهو موضوع نقاش).
الخاتمة
يعد قانون بنفورد أحد الأوامر الرياضية الجميلة المخبأة في عالم يبدو فوضوياً.
يميل حدسنا إلى الاعتقاد بأن “الأرقام تظهر بالتساوي”، ولكن في الواقع، فإن الرقم “1” له حضور ساحق. معرفة هذا القانون قد تغير قليلاً من نظرتك إلى البيانات التي تراها في الأخبار، والبيانات المالية للشركات، وحتى اتساع العالم الطبيعي.
في المرة القادمة التي تتاح لك فيها فرصة التعامل مع كمية كبيرة من البيانات، حاول جدولة “الأرقام الأولى”. بالتأكيد، سيظهر القانون الجميل الذي رسمه منحنى لوغاريتمي هناك.
