RBCode news и не только
Open in Telegram
Здесь последние новости о развитии проекта RBCode и новости из мира футбольной аналитики.
Show more995
Subscribers
-124 hours
-57 days
-1030 days
Posts Archive
ФНЛ / ПФЛ о ком точно знаю
Тверь - Мантуш
Алания - Демуров
Акрон - Жариков
Балтика - Головач
Торпедо - Мичков
Также есть люди кто занимается аналитикой, но я уверенно говорить не могу, отдельный это аналитик или один из штаба:
Зенит-2, Ротор, Амкар, Динамо-2, СКА Ростов, Енисей, Авангард Курск, Факел, Иртыш, Кубань, Нефтехимик, Казанка, СКА Хабаровск, Долгопрудный, Чайка, Велес, Балтика-БФУ
Прошел почти год, пора бы обновить список нашего профсоюза.
РПЛ
Зенит - Гайдовский и отдел
Динамо - Шамин, Печерица. Ушел Титов, пришел руководитель иностранец.
Локомотив - иностранец
Спартак - два иностранца
Сочи - Веряскин, пришел Антонов, Грунюшкин
Ростов - Емин, пришел Головин, Альба ушел в сборную
Ахмат - Гончаренко
Тула - помогает оператор
ЦСКА - Шевелев, пришел Ковалев
Химки - помогает оператор
Краснодар - Малявин, Бианки, Кронфельд
Крылья - вроде бы Титов, но подтверждения нет)
Нижний Новгород - Анкудимов
Рубин - пришёл Васюхин и отдел
Уфа - в штате нет, удаленно помогает Тагиров
Урал - Столбиков, пришли Давлетшин, Краев
В целом динамика позитивная, что не может не радовать. Приход иностранца в Динамо, при оставшихся Шамине и Печерице тоже в целом нормальная ситуация. Отсутствие в Спартаке и Локо своеобразная, но традиционная история. Хотя может я просто не знаю, а отделы существуют.
Важно отметить, что я поменял метод сравнения, вместо сравнения средних показателей по сезону, я сравниваю множество показателей игроков в каждом матче, то есть если сказать упрощённо то раньше мы сравнивали условно одну цифру по каждому игроку (среднее за сезон), то сейчас по каждому игроку у нас показателей столько же, сколько он сыграл матчей.
Мы пока еще не знаем, в какую сторону, но существенные и статистически значимые отличия между опорными топ-клубов РПЛ и остальными опорными можно отследить по следующим показателям:
ассистов с игры
ассистов
xg на удар без пенальти
xgbuildup
xgbuildup с игры
xgbuildup на владение
xgbuildup на владение с игры
xgchain
xgchain с игры
xgchain на владение
xgchain на владение с игры
доставок мяча в фин треть
удачных навесов
доля успешных навесов в штрафную от передач в штрафную
успешность навесов
касаний всего
владений мячом
касаний в штрафной
передач внутри штрафной
передач в фин трети с игры
передач вперед в фин трети
передач поперек в фин трети с игры
точность передач
точных передач
передач всего
передач вперед
передач поперек
передачи с игры
обводок против него
возвратов после прессинга
доля выигранных вверху
Всего один оборонительный параметр, ну ничего себе.
В следующей части попробуем найти какие типы опорных бывают (более точно, чем просто "мухины" и "нобоа"), и что нам с этим делать.
Как мы уже разобрались выше, сравнение средних показателей в большинстве случаев не работает в футболе - может быть еще усеченное среднее, но в целом надо помнить, что распределение данных не нормальное, есть выбросы, причем в футболе мы можем совершить двойную ошибку легко:
- сначала взять среднее по статистике игрока в сезоне
- а потом сравнить это среднее со средним у другого игрока
Все было бы еще неплохо, если бы средние показатели игроков по определенному показателю имели какое-то более-менее допустимое отклонение от нормальности, но в подавляющем большинстве случаев это не так.
Что же делать?
Нам на помощь придут непараметрические показатели для сравнения мер различий для несвязанных выборок.
Основных два - это t-критерий стьюдента, который можно применять в случае если распределение показателей нормальное или незначительно отличается от нормального. В общем-то он достаточно простой, вычитаем из одного среднего арифметического другое и делим на стандартную ошибку.
В целом на этом про Стьюдента можем забыть, потому что распределения в футболе не нормальные, и мы обречены на критерий Манна-Уитни.
Он интуитивно очень простой. Пусть у нас есть 20 опорных из РПЛ и 20 опорных из АПЛ, давайте построим их в ряд по количеству давлений за матч, и пронумеруем от 1 до 40. Лучший получит номер 1, а худший номер 40.
Потом соберем их обратно в кучи по лигам и посчитаем порядковые номера из общего ряда. Чем сильнее различается сумма "рангов" наших опорных, тем сильнее отличаются и опорные в АПЛ и РПЛ.
Но смотрите. Что еще важно. А что если мы случайно разделим опорных на две группы, а не по принадлежности к лиге, а потом сравним? И потом сделаем так еще несколько раз. Что, если разница между случайно выбранными группами будет примерно такая же, как в случае со сравнением опорников РПЛ и опорников АПЛ?
Тут кроется очень важное для понимания утверждение. Что любые различия по статистике (у одного xG больше чем у другого на 0.05 за матч) могут быть СЛУЧАЙНЫМИ. Вопрос в том, как определить где случайные различия, а где нет.
В разных направлениях статистики используются разные p-уровни значимости, стандарт для научных футбольных статей - 5%, хотя у меня есть основания полагать что для футбола его можно легко увеличить до 25%, но об этом как-нибудь потом.
Давайте вооружимся манном-уитни и p-уровнем 0,05, и проверим, а в чем действительно отличаются опорные топ-клубов РПЛ от всех остальных?
Как нас обманывают красивые графики и инфографика. Игроки разных типов, сравнение идет только по показателям, свойственным одному. Выводы делаются, что игрок 1 сильнее, чем игрок 2.
Продолжим. Так в чем же проблема в том, что мы так по разному сравнили Нобоа и Мухина? В том, что это абсолютно разные игроки. Хотя оба - опорные. Но в разных схемах, с разными ролями, и разными качествами.
Мы уже говорили о корреляции. Здесь как раз она нам пригодится. Корреляция считается так - умножаем отклонения от среднего для одного стат показателя, на отклонения от среднего второго показателя и делим на произведения стандартных отклонений.
Что нам дает корреляция?
Она позволяет установить связь между изменениями двух стат показателей. Но она не объясняет характер этой связи, не дает понять ее направление. Но все же показатель нам пригодится.
В нашем случае мы должны подумать о том, что у разных по стилю и таланту опорных будут по разному изменяться не связанные между собой показатели, а связанные между собой показатели будут изменяться плюс минус одинаково.
Тогда мы можем понять, что сравнивать, как в нашем случае выше, по радарам, где фигурируют только связанные между собой показатели - не совсем верно.
Мы установим различие в стиле двух опорных, но не их различие в качестве.
Давайте посмотрим, какие показатели имеют наибольшую корреляцию с количеством давлений на игрока с мячом?
Это игра в прием, количество отборов и перехватов с пересчетом на владение, количество контрпрессингов, количество возвратов мяча после действия игрока, количество фолов и ситуаций, когда игрока обвели.
А какие имеют отрицательную корреляцию или не имеют никакой? Количество передач под удар, количество ударов, изменение точности передач под давлением, средняя высота оборонительных действий, принятие участий во владениях, закончившихся ударом или голом, количество передач с игры и в финальную треть. Ну и много всего другого похожего - прием мяча, точность передач под давлением, количество удачных обводок, xgchain и xgbuildup.
Это же очень естественно. Мы визуально сейчас установили два класса игроков-опорных. Это условные "нобоа" и условные "мухины".
Чего мы сейчас не знаем, и какие вопросы можем задать?
Мы не знаем, какие еще классы (кластеры) игроков у нас есть. Может быть есть кто-то кто на 50% "нобоа" и на 50% "мухин"? Кто-то, кто на 10% "нобоа" и на 10% "мухин"?
Мы теперь можем по другому посмотреть на различия между топовыми и не топовыми опорными. В чем причина? В том что в топ-клубах больше "мухиных"? В том что в топ-клубах условные "нобоа" оказывают больше давлений на мяч? Или в том, что там есть какой-то другой класс, который и обеспечивает это различие?
Кроме того, мы видели что распределение по давлениям среди флоп-опорных отличается от нормального. Так может быть причина в том, что у нас, например, бимодальное распределение, просто какая-то часть выборки очень мала и нам надо выделить их в отдельный клас, а дальнейший анализ проводить уже этим классам?
Или вот еще пример вопроса. А может быть в топ-клубах правильное распределение "мухиных" и "нобоа" внутри команд? То есть в каждой команде есть один "нобоа" и один "мухин"? А во флопах или два нобоа или два мухиных, и поэтому страдает результат?
Давайте разбираться.
Тем не менее, корреляции статистических показателей игроков нам могут пригодиться, и очень даже часто.
Давайте рассмотрим пример двух радаров для сравнения игроков, а вы покритикуйте их, почему и какой радар плох или хорош в различных ситуациях для оценки игроков.
Представьте, что вы решили оценить корреляции каких-то статистических параметров и приходите к выводу что у игроков дороже 10 миллионов евро точность передач выше, чем у тех, кто стоит дешевле 10 миллионов евро.
Но что, если данные в нашей выборке распределены как-то таким образом, что мы сами себя обманули?
Предположим гипотетически, что если мы разложим всех игроков на группы по точности передач, то окажется, что точность передач 70-75 процентов у 25% игроков, 75-80 процентов у 4% игроков, 80-85 процентов у 68% игроков, и 85-90 процентов у 3% игроков
Вы решаете найти какую-то закономерность и оказывается, что почти у всех игроков дороже 10 миллионов точность передач выше 82%.
Вы решили пойти дальше, и анализируете еще и максимум значения точности передач в выборке игроков дороже 10 миллионов.
И прям очень возможно, что окажется, что у всех из них точность передач ниже 85%, ну может быть у 1% из этих игроков точность выше 85%, но ведь у 99% - в пределах 82-85%
Более того, мы знаем только среднюю точность игрока по сезону. И пусть мы знаем его точность передач в сыгранных матчах, и значения этой точности передач на протяжении 10 матчей выглядели следующим образом
1 тур - 78%
2 тур - 78%
3 тур - 78%
4 тур - 78%
5 тур - 78%
6 тур - 86%
7 тур - 86%
8 тур - 86%
9 тур - 86%
10 тур - 86%
А потом на протяжении 10 матчей точность передач у него будет вот прям ровно 82% процента.
К чему все это сложное описание?
Если мы не знаем распределение, и возьмем данные игрока после 5 тура, мы скажем - он не соответствует модели дорогих игроков по своей точности передач,
после 10 тура, посмотрев на средний показатель, мы скажем - он соответствует нашей модели.
Но при этом ни с 1 по 5 тур, ни с 6 по 10 тур в отдельности он нашим характеристикам не соответствовал.
Более того, предположим что таких игроков, кто стоит выше 10 миллионов - примерно 2% в мировом футболе. А что, если мы СЛУЧАЙНО выберем любые 2% игроков? Какова вероятность того, что их описание будет совпадать с описанием нашей модели дорогих?
Это вопросы, которые крайне важно задать самому себе при работе с данными и попыткой сделать какие-либо выводы по ним.
Что думаете по этому поводу? Делали ли вы проверку на уместность использования, например, средних показателей p90 в футбольной статистике?)
Так как количество команд и опорных в АПЛ и РПЛ отличается, то данные по АПЛ я буду приводить в процентах (в скобках процент попавших в эту команду в РПЛ)
Поехали
В команде ФЛОП - 24% (20%)
В команде НЕ СОВСЕМ ФЛОП - 8% (20%) игроков
В команде СРЕДНИЕ - 21%(20%) игроков
В команде ЛУЧШЕ СРЕДНИХ - 5% (10%) игроков
В команде ХОРОШИЕ - 5% (10%) игроков
В команде ОТЛИЧНЫЕ - 8% (10%) игроков
В команде ТОПЫ - 25% (10%) игроков
Так, это уже интересно.
мы видим что команды средних и флопов равны. А вот в сумеречную зону (ниже среднего, выше среднего) попало сильно меньше игроков, чем в РПЛ.
Зато в ТОП попало в 2,5 раза больше игроков, чем в РПЛ.
Мы обнаружили интересную закономерность, что опорники в АПЛ сильнее различаются между собой. Тех, кто оказывает давление на уровне худших в России, чуть больше, чем мы лжидали, а тех, кто оказывает давление на уровне ТОПОВ в России прям сильно больше, чем мы ожидали.
Основное различие в том, что "недо-топы" в Англии сильнее оказывают давление, а "недо-флопы" оказывают меньше давлений на игрока с мячом. При этом среднее количество давлений на одного опорного за 90 минут с нормализацией на владение = примерно одинаковы.
Может быть, дело в том, что есть более четкое разделение на "прессингующего" опорного и "страхующего"? Или в том, что большее количество ТОПОВ позволяет ФЛОПАМ меньше играть в отборе?
Для этого надо бы понять, как изменение показателя давлений на игрока с мячом влияет на остальные показатели, может быть окажется, что чем меньше игрок давит на соперника, тем больше он феерит с мячом.
Но смысл даже не в этом. Смысл в том, что мы заметили разницу, которую на первый взгляд определить было сложно. Сделали мы это, создав категориальный ряд данных, и в случае с футбольной статистикой это действительно неплохо работает. Ну и мы еще раз убедились, что использование мер центральной тенденции в футболе, очень часто, прямо ну очень часто не дает нам никакой дополнительной информации.
еще 10 процентов - в команду тех, у кого давлений от 16,7 до 17,4 (команда "хорошие")
еще 10 процентов - в команду тех, кто делает от 17,4 до 19,1 давлений за игру - команда "отличные"
и еще 10 процентов в команду тех, кто делает от 19,1 до 25,9 давлений за игру. (ТОПЫ)
Кто делает больше 25,9 и меньше 3,9 давлений за игру пока выгоним, разберемся с ними потом.
У нас появились стройные ряды
В команде ФЛОП - 12 игроков
В команде НЕ СОВСЕМ ФЛОП - 11 игроков
В команде СРЕДНИЕ - 12 игроков
В команде ЛУЧШЕ СРЕДНИХ - 5 игроков
В команде ХОРОШИЕ - 6 игроков
В команде ОТЛИЧНЫЕ - 6 игроков
В команде ТОПЫ - 6 игроков
Давайте попробуем по тем же самым границам (то есть по тому же самому количеству давлений в среднем за матч) разбить игроков АПЛ, что получится?
Чем хорош такой метод, мы знаем признаки категорий игроков в РПЛ, распределение между категориями РАВНОМЕРНОЕ, и мы хотим посмотреть, как оно изменится, если мы на те же категории разделим опорных АПЛ.
Итак, что мы видим. Распределение флопов явно не нормальное. В случае с топами все ок.
Что такое нормальное распределение? Ну если совсем совсем просто, то это когда тех, у кого давлений мало - тоже мало, тех у кого давлений много - мало, а тех, у кого давлений в среднем как у всех - много. (https://ru.wikipedia.org/wiki/Нормальное_распределение)
Это если прям совсем тупо и просто. Но у нас не так, есть, во-первых, явное смещение диаграммы влево, и мы это видели, когда проверяли флопов по среднему арифметическому и медиане. Уже то, что медиана оказалась сильно ниже среднего арифметического, должно было нас немного напрячь.
В чем проблема ненормальности распределения? В том, что очень сложно проводить разнообразные тесты, сравнения и так далее. Ну то есть вот мы смотрим на то, что у игрока давлений меньше, чем среднее по лиге, а их у БОЛЬШИНСТВА меньше, чем у среднего.
В футболе это нормально, потому что качества игроков не распределены нормально по командам. И более того, качества игрока не измеряются непрерывно, то есть само приведение показателей игрока к средним показателям часто ошибочно.
Мы описываем игроков часто булевыми значениями (это умеет бить, а этот не умеет, то есть показатель "умеет бить" принимает значение либо 1 либо 0, истина или ложь).
Но практически самыми рабочими для нас будут категориальные данные. То есть мы определяем категории игроков, и пытаемся определить к какой категории тот или иной игрок относится, сколько таких игроков в общем в лиге и так далее.
Это же очень естественно, вот смотрите как (например) рассуждает тренер при выборе состава:
1. мне нужен нападающий, который часто открывается за спину, и полузащитник, который более-менее точно дает такие передачи, а самое главное он их видит и дает
2. мне нужен хороший подающий углового слева и игрок, который хорошо ловит траекторию и обладает ударом головой.
Но при этом мы понимаем, что абсолютный показатель, например, частоты передач за спину, будет сильно отличаться от матча к матчу, от лиги к лиге.
Давайте сделаем какие-то категории, чтобы понять оценку игрока на уровне лиги/команды и потом уже переведем их в натуральный язык. Это можно сделать чуть сложнее и интереснее, но мы пока что все сделаем просто, хотя в итоге и сравним опорных РПЛ и АПЛ немного нетривиально.
Начнем. У нас есть опорные АПЛ, в среднем оказывающие давление на игрока соперника 16,5 раза за игру, медиана 15,9.
И есть все опорные РПЛ, в среднем 16,3 давления за матч, медиана 16.2
Мы уже убедились что есть проблемы с нормальностью распределения выборки, а значит, скорее всего средние значения, даже защищенные от выбросов (медиана) - нас обманывают. Не могут наши опорные ничем не отличаться от опорных АПЛ.
Давайте придумаем категории. Для этого разделим всех опорных на команды по количеству давлений, которое они оказывают на соперника за матч. Сделаем таких команд 10.
Потом выстроим в один ряд всех опорных, кто попал в две худшие команды, за ними тех кто попал в 3-4 команду, за ними тех кто попал в 5-6 команду, и сравним количество людей в 7,8,9,10 команде.
То есть понятно, да, делим всех опорных на 10 команд, а потом всех кто не попал в 40% лучших укрупним, потому что нам флоп не сильно интересен, ведь логично предположить что разница будет в топе.
Как мы это делаем? Ну возвращаясь к прошлому посту, давайте построим всех опорных в линию, и найдем опорного, меньше которого ровно 20%, меньше которого ровно 40%, меньше которого ровно 60%, и так далее.
Запомним показатели, по которым разделили.
В худшую команду у нас попадут опорные с количеством давлений за матч от 3,9 до 10,6 (сюда, напомню, попало 20% опорных) - команда "полный флоп"
Следом за ними команда с количеством давлений 10,6-12,9 (здесь еще 20 процентов от всех опорных) - команда "не совсем флоп"
Дальше идут те, кто оказывает от 12,9 до 15,7 давлений (еще 20 процентов) - команда "средних"
и потом пошли уже более детальные команды
10 процентов попадут в команду тех, у кого давлений от 15,7 до 16,7 - команда "лучше средних"
В комментариях к предыдущей части возник вопрос о том, что такое процентиль.
Часто используется в футбольной статистике, и на самом деле очень простой показатель.
Процентиль показывает, сколько процентов данных в наборе оказалось ниже даннного значения.
То есть если игрок относится к 95-му процентилю по показателю давлений на игрока с мячом, это означает, что 95 процентов игроков имеют показатель меньше, чем у него.
Процентили часто используюся как одна из мер вариабельности. Мы можем посмотреть как распределены показатели по процентилям (квантиль это то же самое, что и процентиль. но выраженный в доле, а не в процентах, то есть 25-й процентиль, это квантиль 0.25).
Одна из самых часто используемых диаграмм для оценки разброса данных использует как раз процентили,
Мы видим на диаграмме "ящик", внутри которого заключены все значения от 25 до 75 процентиля, линия, которая делит ящик - это медиана, а длина "усов" обычно равна 1,5 межквартильного размаха (расстояние между 25 и 75 перцентилем).
Так мы можем оценить визуально, насколько "нормально" (скоро сможем использовать этот термин без кавычек) распределены данные.
На картинке - "ящик с усами" или диаграмма размаха для топовых опорников. Все очень красиво, мы видим что нет выбросов за пределы ящика с усами, усы примерно равны, ящик разделен примерно пополам. Оказание давления топовыми опорными примерно распределено нормально.
Следующим постом скину такую же диаграмму размаха, но уже для флоповых опорных, ну и жду ваши предположения, что мы можем по ней сказать.
Разбавлю нудятину. Утренняя песня нападающих об xG
https://youtu.be/AqrxgEln_Dw
Что за число у нас получилось?
Это и есть среднеквадратичное отклонение, или иначе стандартное отклонение.
И вот вопрос, а зачем оно нужно, все было просто пока мы считали среднее абсолютное отклонение.
Дело в том, что среднее квадратическое обладает рядом отличных математических свойств, которые как раз и помогут в дальнейшем найти аномальные значения в выборке.
Несколько таких свойств (попробуйте предположить, как их использовать)
В нормальном распределении 2/3 всех значений отличаются от среднего не больше, чем на среднее квадратическое
95% всех значений отличаются не больше, чем на два средних квадратических отклонений
И 99,7% лежат в пределах трех средних квадратических.
https://ru.wikipedia.org/wiki/Среднеквадратическое_отклонение
Подытожим
Вариабельность топов мы оценили следующими показателями
среднее абсолютное отклонение 2.86
дисперсия (среднее квадратов отклонений) 13.6
Среднее квадратическое отклонение (корень из дисперсии) 3.69
флопы
среднее абсолютное отклонение 4.37
дисперсия (среднее квадратов отклонений) 37.68
Среднее квадратическое отклонение (корень из дисперсии) 4.37
Какие выводы делаем?
Показатель позволяет нам сказать, что Топы делают больше давлений, чем Флопы, но если среди флопов мы найдем игрока, которые делает на 4-5 давлений за матч больше, это не гарантирует что он станет топом, просто потому что даже такое отличие это нормально для выборки флопов.
Для Топов критерии вариабельности более строгие, то есть топ, делающий на 4 давления за матч меньше среднего, вызывает больше внимания, чем флоп, делающий на 4 больше. Просто потому что у Топов все гораздо плотнее.
Для чего еще можно использовать? ну предположим вы строите какую-то систему оценки игроков, и хотите влючить Показатель в систему оценки. Вы понимаете, что у топов и флопов он будет разным, а внутри топов и флопов будет сильно отличаться.
Давайте проверим каждый показатель на его "нормальность". К примеру, если показатель выше, чем среднее в выборке (топ или флоп) + среднее квадратическое отклонение, то мы введем новый показатель, назовем его "выше нормального давлений" и присвоим значение 1. А если показатель ниже, чем среднее минус ср кв отклонение, то присвоим ему значение -1. Во всех остальных случах будет значение = 0.
И вот уже мы можем получить тогда определенные списки игроков по каждому показателю, дать им определенные, даже словесные характеристики.
Где это может применяться?
Например, можно перейти от использования цифровых таблиц в отчетах по игрокам к натуральному языку. Заходите на страницу игрока в каком-то-скауте, а там вам пишут не "выиграно 84% единоборств", а "выделяется по оказанию давления на игрока с мячом в группе топ-опорных своей лиги". Прикольно же?)
Но это очень утрированная схема, а чтобы разобраться в этом получше, нам понадобятся "меры различий для несвязанных выборок".
В следующей части :) желающие дополнить примеры и подумать, как это применять, могут оставлять комментарии.
Важно что данная серия постов направлена не на анализ конкретных игроков, а на знакомство со понятиями и методами применения статистики, более аккуратного ее использования широкими массами аналитиков)
Оценки вариабельности
От канала отпали те, кто не ожидал тут такой скукоты, ну и отлично, а мы продолжаем.
Итак, мы заметили, что между собой, внутри выборок топовых и флоповых опорников из генеральной совокупности опорных в РПЛ, флопы отличаются между собой как-то сильнее, чем топы. Мы заметили это межквартильному размаху, то есть по "расстоянию" от того опорного, ниже которого 25% других от общего числа, и опорного, выше которого 25% от общего числа.
То есть такие в среднем худший и в среднем лучший.
В случае с флопами худший делает на 7.5 давлений меньше, чем лучший, а в случа с топами - разница в полтора раза меньше.
Но это только один из способов понять насколько опорные в выборке топов и флопов в среднем отличаются друг от друга.
Эти меры вариабельности могут быть очень полезны, если например вы хотите понять, насколько стабилен игрок по дистанции (берем какой-то его показатель и считаем его вариабельность на протяжении сезона). А еще можно сравнить стабильность в разных турнирах, например, мы будем знать насколько игрок стабилен в РПЛ (это будет какое-то число), и насколько стабилен в играх еврокубков. И тогда можем предположить, насколько его стабильность будет изменяться при переходе из менее сильного турнира в более сильный - и так далее.
Применить эти методы можно к чему угодно, да хоть к количеству минут. Например посмотрим вариабельность игровых минут в РПЛ и в матчах за сборную, и сделаем какие-то выводы типа "в сборной игрок основы, а в клубе нет".
Ну давайте вернемся к нашим топовым и флоповым опорным.
Зачем нам межквартильынй размах, ведь можно просто взять показатели всех опорных и посмотреть, насколько они отличаются от среднего.
Ну то есть вот средний показатель 18.5, мы берем и получаем разницы между показателем каждого опорного и средним, складываем их и делим на количество. Что мы получим?)
Мы очень легко можем получить 0. Почему? Потому что один сделал на 5 давлений больше, чем среднее, а второй на 5 меньше. Сложим их - получим 0.
Но это не даст нам новой информации. Что можно сделать?
Можно посчитать среднее абсолютное отклонение.
То есть каждую разницу берем по модулю (кто забыл, то это значит просто отбрасываем минус, то есть вместо минус 5 мы получим 5).
И тогда мы получим среднее абсолютное отклонение.
Для топов оно равно 2.86
Для флопов = 4.37
То есть если мы знаем что игрок играет не в топ клубе, и делает давлений на игрока с мячом в среднем за матч где-то в пределах среднее (15.6) плюс минус 4.37 давлений то его показатели в целом вполне нормально вписываются в характеристики среднего опорного нижней половины таблицы, и говорить о том, что игрок с 13 давлениями на соперника и игрок с 17 владениями на соперника прям сильно отличаются я бы не стал, ну просто потому что (как это часто в футбольной статистике бывает) ну так сложились звезды. А вот если он делает, скажем, 25 давлений за матч, то это уже точно выдающийся показатель. но пока как-то слишком топорно мы определяем что является обычным, а что - нет.
Статистики зачем-то выдумали более сложную субстанцию, которая называется дисперсия и среднее квадратическое отклонение, которое к тому же зачем-то назвали стандартным.
Для начала о том, что это такое.
Дисперсия очень похожа на среднее абсолютное или линейное отклонение. Просто по другому решается проблема отрицательных значений. Все разности мы возводим в квадрат (квадраты насколько помним всегда положительны). А потом находим среднее от квадратов отклонений.
Дисперсия топов по показателю количество давлений за матч, нормализованных на владение (дальше я буду просто писать Показатель) = 13.6
А для флопов = 37.6
Что за фигня? Как с этим работать?
У нас был нормальный Показатель = давление на игрока с мячом. мы возвели его в квадрат, и что за хрень получилась? Неудобно.
Давайте извлечем корень квадратный из дисперсии, чтобы опять вернуться к нормальным единицам измерения,
Для топов квадрат из дисперсии = 3.69
Для флопов = 6.13
Тут мы уверены, что мы опять считаем в нормальных единицах измерения, а не в каких-то квадратах давлений.
