<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Статистика on kenji.blog</title><link>http://kenji.blog/ru/categories/%D1%81%D1%82%D0%B0%D1%82%D0%B8%D1%81%D1%82%D0%B8%D0%BA%D0%B0/</link><description>Recent content in Статистика on kenji.blog</description><generator>Hugo -- gohugo.io</generator><language>ru</language><copyright>kenjinote</copyright><lastBuildDate>Thu, 10 Sep 2026 21:00:00 +0900</lastBuildDate><atom:link href="http://kenji.blog/ru/categories/%D1%81%D1%82%D0%B0%D1%82%D0%B8%D1%81%D1%82%D0%B8%D0%BA%D0%B0/index.xml" rel="self" type="application/rss+xml"/><item><title>«Положительный результат теста» не всегда означает «болезнь»? Ошибка базового процента</title><link>http://kenji.blog/ru/p/base-rate-fallacy/</link><pubDate>Thu, 10 Sep 2026 21:00:00 +0900</pubDate><guid>http://kenji.blog/ru/p/base-rate-fallacy/</guid><description>&lt;img src="http://kenji.blog/p/base-rate-fallacy/img/base_rate_fallacy.jpg" alt="Featured image of post «Положительный результат теста» не всегда означает «болезнь»? Ошибка базового процента" />&lt;p>Если на медицинском или онкологическом обследовании вы получите результат «положительно (есть отклонения)», любой человек впадет в панику.
Однако, если у вас есть знания в области статистики и теории вероятностей, возможно, вы сможете сделать глубокий вдох и успокоиться. Все потому, что &lt;strong>«положительный результат высокоточного теста» вовсе не означает, что «вероятность того, что вы действительно больны, высока»&lt;/strong>.&lt;/p>
&lt;p>Это типичное когнитивное искажение, при котором человеческая интуиция сильно ошибается в расчетах вероятности, называемое &lt;strong>«ошибкой базового процента (Base Rate Fallacy)»&lt;/strong> или «игнорированием априорной вероятности».&lt;/p>
&lt;h2 id="пугающая-проблема-медицинского-обследования">Пугающая проблема медицинского обследования
&lt;/h2>&lt;p>Представьте себе следующую ситуацию.&lt;/p>
&lt;p>В одном городе есть неизвестная болезнь, которой заражен 1 человек из 10 000 (0,01%).
Для выявления этой болезни был разработан отличный набор для тестирования с &lt;strong>«точностью 99%»&lt;/strong>.
(*Точность 99% означает, что если тест проходит больной человек, то с вероятностью 99% результат будет правильно определен как «положительный», а если здоровый человек — с вероятностью 99% он будет правильно определен как «отрицательный».)&lt;/p>
&lt;p>Вы случайно прошли этот тест, и результат оказался &lt;strong>«положительным»&lt;/strong>.
Итак, какова вероятность того, что вы &lt;strong>действительно заражены этой болезнью&lt;/strong>?&lt;/p>
&lt;p>Многие люди интуитивно ответят: «Раз точность теста 99%, значит, вероятность того, что я болен, тоже 99%».
Однако математически правильный ответ — &lt;strong>«около 0,98% (менее 1%)»&lt;/strong>.&lt;/p>
&lt;p>Почему же при точности 99% фактическая вероятность оказывается меньше 1%?&lt;/p>
&lt;h2 id="теорема-байеса-и-визуализация-картины-в-целом">Теорема Байеса и визуализация картины в целом
&lt;/h2>&lt;p>Ключ к разгадке этой проблемы заключается в учете не только точности теста, но и того, &lt;strong>«насколько эта болезнь изначально редка (базовый процент / априорная вероятность)»&lt;/strong>.
Давайте визуализируем это противоречащее интуиции явление на примере большой группы из 1 000 000 человек.&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Общее количество людей&lt;/strong>: 1 000 000 человек&lt;/li>
&lt;li>&lt;strong>Действительно больные люди&lt;/strong> (1 на 10 000): 100 человек&lt;/li>
&lt;li>&lt;strong>Здоровые люди&lt;/strong>: 999 900 человек&lt;/li>
&lt;/ul>
&lt;p>Всем этим 1 миллиону человек проводится тест с «точностью 99%».&lt;/p>
&lt;h3 id="1-если-тест-проходят-действительно-больные-люди-100-человек">1. Если тест проходят действительно больные люди (100 человек)
&lt;/h3>&lt;p>Так как точность 99%, правильно определены как «положительные» будут:
100 человек × 99% = &lt;strong>99 человек&lt;/strong> (истинно положительные)&lt;/p>
&lt;h3 id="2-если-тест-проходят-здоровые-люди-999-900-человек">2. Если тест проходят здоровые люди (999 900 человек)
&lt;/h3>&lt;p>Так как точность 99%, есть люди, которые с вероятностью 1% будут ошибочно определены как «положительные» (ложноположительные):
999 900 человек × 1% = &lt;strong>9 999 человек&lt;/strong> (ложноположительные)&lt;/p>
&lt;div class="mermaid">graph TD
A["Всё население (1 000 000 человек)"] --> B["Больные люди (100 человек)"]
A --> C["Здоровые люди (999 900 человек)"]
B -->|Верно на 99%| B1["Истинно положительные (99 человек)"]
B -->|Ошибка на 1%| B2["Ложноотрицательные (1 человек)"]
C -->|Верно на 99%| C1["Истинно отрицательные (989 901 человек)"]
C -->|Ошибка на 1%| C2["Ложноположительные (9 999 человек)"]
B1 -.-> D{"Общее число людей, получивших результат 'Положительный': 10 098 человек"}
C2 -.-> D
style A fill:#ECEFF1,stroke:#333
style B fill:#FFCDD2,stroke:#333
style C fill:#C8E6C9,stroke:#333
style B1 fill:#F44336,stroke:#333,color:#fff
style C2 fill:#FF9800,stroke:#333,color:#fff
style D fill:#FFF9C4,stroke:#333,stroke-width:2px&lt;/div>
&lt;h2 id="истинная-вероятность-того-что-вы-больны">Истинная вероятность того, что вы больны
&lt;/h2>&lt;p>Итак, врач сообщил вам: «У вас положительный результат».
Это означает, что вы попали в группу «Общее число людей, получивших результат &amp;lsquo;Положительный&amp;rsquo; (10 098 человек)», расположенную в правой нижней части схемы.&lt;/p>
&lt;p>Какова доля &lt;strong>«действительно больных людей (истинно положительных)»&lt;/strong> в этой группе?&lt;/p>
$$ \text{Вероятность того, что вы действительно больны} = \frac{\text{Истинно положительные}}{\text{Все получившие положительный результат}} = \frac{99}{99 + 9,999} = \frac{99}{10,098} \approx 0.0098 $$
&lt;p>Результат расчета — &lt;strong>около 0,98%&lt;/strong>.
Несмотря на то, что вам сказали о «положительном» результате, вероятность того, что вы здоровы (ложноположительный результат), подавляюще выше (около 99%).&lt;/p>
&lt;h2 id="почему-интуиция-ошибается">Почему интуиция ошибается?
&lt;/h2>&lt;p>Это явление математически объясняется &lt;strong>«теоремой Байеса»&lt;/strong> для вычисления условной вероятности, но человеческий мозг очень плохо справляется с такими вычислениями.&lt;/p>
&lt;p>Причина, по которой мы совершаем ошибку, заключается в том, что мы отвлекаемся на индивидуальную и яркую информацию, предоставленную нам прямо сейчас («Ваш результат теста положительный! Точность 99%!»), и игнорируем огромные и скучные статистические данные на заднем плане («Изначально этой болезнью болеет только 1 из 10 000 человек (базовый процент)»).&lt;/p>
&lt;p>&lt;strong>Поскольку «редкость болезни (0,01%)» гораздо более экстремальна, чем «неточность теста (1%)», незначительные ошибки тестирования мгновенно поглощают истинное число больных.&lt;/strong>&lt;/p>
&lt;h2 id="ошибка-базового-процента-скрывающаяся-в-обществе">«Ошибка базового процента», скрывающаяся в обществе
&lt;/h2>&lt;p>Эта иллюзия вызывает панику и ошибочные суждения не только в медицине, но и в различных других ситуациях.&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Системы распознавания лиц и террористы&lt;/strong>:
Даже если камера с распознаванием лиц с точностью 99,9% обнаружит «террориста» в аэропорту, поскольку базовая вероятность наличия террориста крайне мала, задержанными окажутся в основном невинные обычные люди с похожими лицами (ложноположительный результат).&lt;/li>
&lt;li>&lt;strong>Дорожно-транспортные происшествия и пожилые водители&lt;/strong>:
Даже если вы почувствуете опасность, увидев новости о том, что «〇〇% автомобилей, попавших в аварии, управлялись пожилыми людьми», если не учесть «долю пожилых людей среди всех водителей на дорогах (базовый процент)», будет непонятно, действительно ли эта конкретная возрастная группа более склонна к авариям.&lt;/li>
&lt;/ul>
&lt;p>«Ошибка базового процента» учит нас важности статистического мышления: когда мы видим шокирующие цифры или отдельные случаи, нам следует возвращаться к вопросу: &lt;strong>«Насколько вообще вероятно, что это произойдет в целом (базовый процент)»&lt;/strong>.&lt;/p></description></item><item><title>Парадокс Симпсона: загадочное явление, когда выигрывая в частностях, вы проигрываете в целом</title><link>http://kenji.blog/ru/p/simpsons-paradox/</link><pubDate>Thu, 10 Sep 2026 07:00:00 +0900</pubDate><guid>http://kenji.blog/ru/p/simpsons-paradox/</guid><description>&lt;img src="http://kenji.blog/p/simpsons-paradox/img/simpsons_paradox.jpg" alt="Featured image of post Парадокс Симпсона: загадочное явление, когда выигрывая в частностях, вы проигрываете в целом" />&lt;h2 id="1-в-какой-больнице-лучше-сделать-операцию">1. В какой больнице лучше сделать операцию?
&lt;/h2>&lt;p>Вы тяжело заболели, и вам необходимо сделать операцию.
Перед вами два варианта: больница А и больница Б. Вы запросили данные о «проценте успеха» операций в каждой из них.&lt;/p>
&lt;p>&lt;strong>【Общий процент успеха】&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Больница А&lt;/strong>： Из 1000 человек операция прошла успешно у 900 (процент успеха &lt;strong>90%&lt;/strong>)&lt;/li>
&lt;li>&lt;strong>Больница Б&lt;/strong>： Из 1000 человек операция прошла успешно у 800 (процент успеха &lt;strong>80%&lt;/strong>)&lt;/li>
&lt;/ul>
&lt;p>Посмотрев на это, любой подумает: «Больница А лучше!».
Однако вы человек осторожный и решили более детально изучить, как меняются данные в зависимости от тяжести заболевания (легкая или тяжелая форма).&lt;/p>
&lt;p>&lt;strong>【Процент успеха у пациентов с легкой формой】&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Больница А&lt;/strong>： Из 100 человек операция прошла успешно у 99 (процент успеха &lt;strong>99%&lt;/strong>)&lt;/li>
&lt;li>&lt;strong>Больница Б&lt;/strong>： Из 900 человек операция прошла успешно у 870 (процент успеха &lt;strong>96%&lt;/strong>)
$\rightarrow$ В случае легкой формы заболевания, &lt;strong>выигрывает больница А (99% &amp;gt; 96%)&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>&lt;strong>【Процент успеха у пациентов с тяжелой формой】&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Больница А&lt;/strong>： Из 900 человек операция прошла успешно у 801 (процент успеха &lt;strong>89%&lt;/strong>)&lt;/li>
&lt;li>&lt;strong>Больница Б&lt;/strong>： Из 100 человек операция прошла успешно у 70 (процент успеха &lt;strong>70%&lt;/strong>)
$\rightarrow$ Даже в случае тяжелой формы заболевания, &lt;strong>выигрывает больница А (89% &amp;gt; 70%)&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>Эй? Вам не кажется это странным?&lt;/p>
&lt;p>Для пациентов с «легкой» формой процент успеха выше в больнице А.
Для пациентов с «тяжелой» формой процент успеха также выше в больнице А.
И все же, если посчитать «общий» процент успеха для всех пациентов вместе&amp;hellip;?&lt;/p>
&lt;ul>
&lt;li>Больница А в целом： $(99 + 801) / 1000 =$ &lt;strong>90%&lt;/strong>&lt;/li>
&lt;li>Больница Б в целом： $(870 + 70) / 1000 =$ &lt;strong>94%&lt;/strong>……стоп, согласно предыдущим подсчетам, это было &lt;strong>80%?&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>Подождите, давайте еще раз посмотрим на первоначальные данные.
Первоначальные данные были такими:&lt;/p>
&lt;ul>
&lt;li>Общий процент успеха в больнице А： &lt;strong>90%&lt;/strong>&lt;/li>
&lt;li>Общий процент успеха в больнице Б： &lt;strong>80%&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>Однако, если мы пересчитаем, используя детально разбитые данные, то общий процент успеха больницы Б должен составить $(870 + 70) / 1000 = 940 / 1000 = $ &lt;strong>94%&lt;/strong>.&lt;/p>
&lt;p>&lt;strong>…Да, вас обманули!&lt;/strong>
На самом деле, именно этот трюк с числами и является пугающей статистической ловушкой, которую мы сегодня разберем.
Давайте я покажу вам правильные данные.&lt;/p>
&lt;hr>
&lt;h2 id="2-тем-кого-обманули-настоящие-данные">2. Тем, кого обманули: настоящие данные
&lt;/h2>&lt;p>&lt;strong>【Процент успеха у пациентов с легкой формой】&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Больница А&lt;/strong>： Из 900 человек операция прошла успешно у 870 (процент успеха &lt;strong>96%&lt;/strong>)&lt;/li>
&lt;li>&lt;strong>Больница Б&lt;/strong>： Из 100 человек операция прошла успешно у 99 (процент успеха &lt;strong>99%&lt;/strong>)
$\rightarrow$ В случае легкой формы заболевания, &lt;strong>выигрывает больница Б (99% &amp;gt; 96%)&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>&lt;strong>【Процент успеха у пациентов с тяжелой формой】&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Больница А&lt;/strong>： Из 100 человек операция прошла успешно у 30 (процент успеха &lt;strong>30%&lt;/strong>)&lt;/li>
&lt;li>&lt;strong>Больница Б&lt;/strong>： Из 900 человек операция прошла успешно у 315 (процент успеха &lt;strong>35%&lt;/strong>)
$\rightarrow$ Даже в случае тяжелой формы заболевания, &lt;strong>выигрывает больница Б (35% &amp;gt; 30%)&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>То есть, как при легкой, так и при тяжелой форме заболевания, &lt;strong>больница Б намного превосходит больницу А&lt;/strong>.&lt;/p>
&lt;p>Теперь давайте суммируем это в «общем» итоге.&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Больница А в целом&lt;/strong>： $(870 + 30) / (900 + 100) = 900 / 1000 =$ &lt;strong>процент успеха 90%&lt;/strong>&lt;/li>
&lt;li>&lt;strong>Больница Б в целом&lt;/strong>： $(99 + 315) / (100 + 900) = 414 / 1000 =$ &lt;strong>процент успеха 41%&lt;/strong>&lt;/li>
&lt;/ul>
&lt;p>Как же так? Если смотреть на «части», больница Б везде выигрывает, но если объединить все в «целое», то больница А одерживает убедительную победу!
Именно это явление и называется &lt;strong>«парадоксом Симпсона»&lt;/strong>.&lt;/p>
&lt;div class="mermaid">graph TD
subgraph "Частичные данные (победа Б)"
Light["Легкая форма: победа больницы Б (99% > 96%)"]
Heavy["Тяжелая форма: победа больницы Б (35% > 30%)"]
end
subgraph "Общие данные (победа А)"
Total["Общий итог: убедительная победа больницы А (90% > 41%)"]
end
Light -->|При объединении результат почему-то меняется на противоположный| Total
Heavy -->|При объединении результат почему-то меняется на противоположный| Total
style Total fill:#ff9999,stroke:#333,stroke-width:2px&lt;/div>
&lt;hr>
&lt;h2 id="3-почему-происходит-такой-странный-разворот">3. Почему происходит такой странный разворот?
&lt;/h2>&lt;p>Природа этого парадокса кроется в &lt;strong>«смещении параметров (знаменателя)»&lt;/strong> и наличии &lt;strong>«скрытых переменных (вмешивающихся факторов)»&lt;/strong>.&lt;/p>
&lt;p>Внимательно посмотрите на данные.&lt;/p>
&lt;ul>
&lt;li>Больница А принимает &lt;strong>в большом количестве (900 человек) «пациентов с легкой формой, которых легко вылечить»&lt;/strong>.&lt;/li>
&lt;li>Больница Б принимает &lt;strong>в большом количестве (900 человек) «пациентов с тяжелой формой, которых трудно вылечить»&lt;/strong>.&lt;/li>
&lt;/ul>
&lt;p>Так как в больнице Б работают отличные специалисты, она стала своеобразной «последней надеждой», принимая множество сложных, тяжелобольных пациентов, от которых отказываются в других местах. Естественно, процент успеха у тяжелобольных пациентов будет ниже (35%). «Общий процент успеха» больницы Б оказался визуально заниженным (41%) из-за того, что его потянул вниз низкий процент успеха этого огромного числа тяжелобольных пациентов.&lt;/p>
&lt;p>С другой стороны, больница А в основном занимается лечением простых случаев, пациентов с легкой формой, из-за чего ее общий процент успеха выглядит высоким (90%). Однако при сравнении в равных условиях (тяжелые с тяжелыми, легкие с легкими), ее мастерство оказалось хуже, чем у больницы Б.&lt;/p>
&lt;p>Если выразить это математически, причина кроется в свойствах сложения дробей.
В общем случае, даже если $\frac{a}{b} &lt; \frac{A}{B}$ и $\frac{c}{d} &lt; \frac{C}{D}$, это не означает, что
&lt;/p>
$$ \frac{a+c}{b+d} &lt; \frac{A+C}{B+D} $$
&lt;p>
будет выполняться всегда. Когда размеры знаменателей сильно отличаются, направление знака неравенства может измениться на противоположное.&lt;/p>
&lt;hr>
&lt;h2 id="4-парадокс-симпсона-в-реальном-мире">4. «Парадокс Симпсона» в реальном мире
&lt;/h2>&lt;p>Этот парадокс — не просто арифметическая головоломка, он часто встречается в реальном обществе и вызывает бурные споры.&lt;/p>
&lt;h3 id="подозрения-в-гендерной-дискриминации-в-калифорнийском-университете-в-беркли-в-1973-году">Подозрения в гендерной дискриминации в Калифорнийском университете в Беркли в 1973 году
&lt;/h3>&lt;p>Когда исследовали процент приема в аспирантуру Беркли, оказалось, что «процент приема среди мужчин (44%)» был значительно выше, чем «процент приема среди женщин (35%)», что стало проблемой, поскольку указывало на очевидную дискриминацию в отношении женщин.
Однако, когда данные были детально разбиты и проанализированы «по факультетам», выявился удивительный факт.
Почти на всех факультетах &lt;strong>процент приема женщин был выше, чем мужчин&lt;/strong>.&lt;/p>
&lt;p>Почему общие цифры перевернулись?
На самом деле, женщины чаще подавали заявления на «факультеты с низким процентом приема (где высокая конкуренция)», в то время как мужчины чаще подавали заявления на «факультеты с высоким процентом приема (куда легко поступить)».&lt;/p>
&lt;h3 id="данные-об-эффективности-вакцин-против-коронавируса">Данные об эффективности вакцин против коронавируса
&lt;/h3>&lt;p>Однажды распространились данные, гласящие: «Уровень смертности среди вакцинированных людей выше, чем среди невакцинированных», что вызвало переполох.
Это также результат игнорирования данных по возрастным группам (скрытой переменной).
Поскольку вакцины в первую очередь предлагались «пожилым людям (у которых уровень смертности изначально выше)», простое сложение общих показателей смертности привело к тому, что в группе вакцинированных оказалось крайне много пожилых людей, из-за чего показатель смертности визуально стал выше.&lt;/p>
&lt;p>При сравнении по возрастным группам было подтверждено, что во всех возрастных группах «уровень смертности среди вакцинированных людей ниже».&lt;/p>
&lt;hr>
&lt;h2 id="5-заключение-данные-не-лгут-но-люди-могут-лгать-с-помощью-данных">5. Заключение: данные не лгут, но люди могут лгать с помощью данных
&lt;/h2>&lt;p>Парадокс Симпсона предостерегает об &lt;strong>«опасности принятия решений, основываясь только на общих данных, таких как средние значения или суммы»&lt;/strong>.&lt;/p>
&lt;p>В мире полно компаний, политиков и средств массовой информации, которые выхватывают только «общие цифры», чтобы представить себя в выгодном свете.
Даже если вам говорят: «Наш продукт А имеет более высокий уровень общей удовлетворенности, чем продукт Б конкурента!», возможно, если разделить пользователей на «молодежь» и «пожилых», продукт Б окажется победителем в обеих группах.&lt;/p>
&lt;p>При изучении данных не обманывайтесь поверхностными «общими» цифрами, а выработайте привычку сомневаться: «Нет ли крайнего перекоса в пропорциях групп из-за скрытых переменных (возраст, пол, тяжесть заболевания и т.д.)?». Это станет вашим самым сильным оружием для выживания в современном информационном обществе.&lt;/p></description></item></channel></rss>