Kitabı oxu: «Профессия - аналитик букмекерской компании»
БОЛЬШОЙ ПРАКТИЧЕСКИЙ КУРС
ПРОФЕССИЯ «АНАЛИТИК БУКМЕКЕРСКОЙ КОМПАНИИ»
Статистика и данные. Вероятности и коэффициенты. Футбольные модели.
ML и калибровка. Линия и CLV. Серии и live. KNN и стратегии.
12 модулей · 120 уроков · 18 чек-листов · глоссарий
Второе издание — переработанное и расширенное
Учебные примеры не гарантируют прибыль: книга о качестве решений и дисциплине анализа.
Как устроена и как пользоваться книгой
Книга построена как маршрут: от перевода коэффициентов в вероятности (модуль 2) — к инженерной системе, которая получает данные, строит вероятность, сравнивает её с рынком, проверяет калибровку и следит, не исчез ли сигнал (модули 8–9). Финальный модуль собирает всё в защищаемый проект.
Каждый урок имеет постоянную структуру: «Суть» (теория с оглядкой на практику), «Формула» (минимум математики, который надо уметь воспроизвести), «Пример с числами» (кейс с честной арифметикой), «Типичные ошибки» (каталог самообмана по теме), «Задание» (применение к вашим данным) и «Вопросы для самопроверки». Уроки 9 и 10 каждого модуля — практикум и контроль: интегральный кейс и вопросы с эталонными ответами.
Три способа чтения. Линейный — для первого прохода: книга не перескакивает через зависимости. Проектный — для практика: читайте модули 2–3, затем сразу модуль 10, возвращаясь к тематическим блокам по запросу проекта. Справочный — для работающего стола: приложения в конце книги — это восемнадцать плотных чек-листов, заточенных под операционное использование.
Практическое правило курса, повторяемое намеренно до навязчивости: любая гипотеза проходит один путь — baseline → временной backtest → out-of-sample → forward test → оценка неопределённости. Книга считается усвоенной, когда эта цепочка выполняется автоматически, а не вспоминается.
Карта курса
Важно: о границах применимости
□ Модуль 1. Профессия аналитика — роль, данные, вероятность как язык, дисциплина процесса.
□ Модуль 2. Вероятности и коэффициенты — имплайд-вероятности, маржа, devig, EV и чувствительность.
□ Модуль 3. Статистика и данные — выборки, бутстрэп, утечки, множественные сравнения, временные разрезы.
□ Модуль 4. Футбольные модели — Пуассон, Skellam, Dixon–Coles, xG, рейтинги атаки и защиты.
□ Модуль 5. ML и калибровка — бустинг/лес/логрегрессия, log loss, Brier, reliability, ансамбли.
□ Модуль 6. Линия и CLV — жизненный цикл цены, price discovery, окна исполнения.
□ Модуль 7. Серии и тренды — автокорреляция, EWMA, марковские состояния, change points, регрессия к среднему.
□ Модуль 8. Live / in-play — state-space, hazard rate, latency, скрытые состояния.
□ Модуль 9. Аналитический стол — пайплайны, дашборды, алерты, реестр моделей, пост-мортемы.
□ Модуль 10. Финальный проект — полный цикл от датасета до защиты.
□ Спецблок. KNN — ближайшие соседи: метрики, веса, локальные режимы, поиск аналогов.
□ Research. Стратегии сообщества — CLV, line shopping, stale lines, миддлинг, арбитраж, пропсы, тайминг.
Книга посвящена аналитике и исследовательским методам. Ни один метод курса не гарантирует прибыль: спортивные рынки — конкурентная среда, где большинство участников проигрывает маржу, а финансовый результат любой стратегии подвержен сильной дисперсии на любых практических горизонтах.
Все числовые примеры носят учебный характер и опираются на упрощённые или синтетические данные; совпадения с реальными рынками случайны. Реальные решения требуют риск-менеджмента, контроля качества данных, юридической проверки применимости в вашей юрисдикции и ответственного отношения к азартным играм.
Если азартные игры перестают быть развлечением и начинают влиять на вашу жизнь — обратитесь за профессиональной помощью. Информация о линиях поддержки доступна в вашем регионе.
Модуль 1. Профессия аналитика
Роль, мышление, данные и рабочий процесс спортивного аналитика
Аналитик букмекерской компании — это не человек, который «хорошо разбирается в спорте». Это специалист, который превращает неопределённость спортивных событий в измеримые вероятности, а вероятности — в устойчивые решения под давлением рынка. Его продукт — не прогнозы, а воспроизводимый процесс: от постановки гипотезы до проверки результата.
В этом модуле мы разбираем, как устроена профессия изнутри: чем аналитик отличается от каппера и от data-инженера, какие данные он использует, что такое benchmark и почему без базовой линии не существует ни одного «успешного» результата. Отдельно разбираем типичные ошибки мышления, культуру документации и командную работу.
Ключевая мысль модуля: доказательство важнее истории. Красивая логика «почему команда должна выиграть» ничего не стоит, пока гипотеза не сформулирована до результата, не проверена на отложенной выборке и не сравнена с простой альтернативой.
ЧЕМУ ВЫ НАУЧИТЕСЬ В ЭТОМ МОДУЛЕ
• Понять границы роли: что аналитик делает и чего он не делает
• Научиться фиксировать момент доступности информации до построения модели
• Освоить понятия baseline, benchmark и предрегистрация гипотезы
• Разобрать типичные когнитивные ошибки спортивного аналитика
• Построить личный процесс: гипотеза → данные → проверка → вывод
1.1. Роль аналитика: кто он и за что отвечает
Аналитик в букмекерской индустрии отвечает за качество чисел, а не за яркость мнений. Его основной артефакт — оценка вероятности исхода, полученная воспроизводимым способом: из зафиксированных данных, по зафиксированной процедуре, с измеренной исторической точностью. Если оценку нельзя воспроизвести по описанию процесса — это не оценка, а мнение.
Внутри профессии выделяют три контура. Первый — исследовательский: поиск сигналов, формализация гипотез, отсеивание случайных закономерностей. Второй — продуктово-инженерный: подготовка данных, мониторинг моделей, поддержка линии. Третий — управленческий: оценка риска, лимиты, коммуникация с трейдерами. На старте карьеры почти всё время занимает первый контур, и именно в нём закладываются профессиональные привычки.
Принципиальная граница роли: аналитик не «предсказывает будущее». Он оценивает распределение вероятностей и сравнивает его с рыночной ценой. Даже модель с долгосрочным преимуществом будет регулярно ошибаться в отдельных событиях — профессионализм измеряется качеством процесса на дистанции, а не исходом конкретного матча.
Кейс: два аналитика и один матч
Аналитик А говорит: «Команда в отличной форме, соперник уставший после еврокубков — берём победу хозяев». Аналитик Б фиксирует: вероятность победы хозяев по его модели 0.54 при рыночной имплайд-вероятности 0.48; сигнал получен из признаков, доступных за 48 часов до матча; на отложенной выборке из 1 200 событий подобного рода модель показала Brier 0.205 против 0.213 у базовой линии. Матч заканчивается вничью. Для внешнего наблюдателя оба «ошиблись». Для профессионала разница принципиальна: решение А невозможно ни повторить, ни улучшить, ни проверить; решение Б — элемент статистики, которая через сотни повторений покажет истинное качество процесса. Из кейса следует рабочее правило: оценивайте решения, а не исходы. Плохое решение иногда выигрывает, хорошее иногда проигрывает — но только второе масштабируется.
ТИПИЧНЫЕ ОШИБКИ
✗ Путать роль аналитика с ролью прогнозиста: цель не «угадать матч», а построить процесс, стабильно оценивающий вероятности.
✗ Измерять себя отдельными событиями, а не распределением результатов на дистанции.
✗ Подменять доказательство уверенным тоном: убедительная формулировка не увеличивает точность модели ни на долю процента.
ЗАДАНИЕ
Опишите паспорт своего рабочего процесса на одну страницу: какие данные вы используете, в какой момент они доступны, какой у вас baseline, какую метрику качества считаете главной и при каком результате вы признаёте гипотезу проваленной. Сохраните документ — в конце курса вы сравните его с итоговой версией.
Вопросы для самопроверки
1. Чем артефакт аналитика отличается от прогноза каппера?
2. Почему выигрыш одиночного события не подтверждает качество решения?
3. Назовите три контура работы аналитика и их главные артефакты.
1.2. Данные: что мы знаем и когда мы это узнали
Центральный вопрос работы с данными — не «что в таблице», а «что было известно в момент прогноза». Спортивная история переписывается задним числом постоянно: составы уточняются, травмы публикуются с задержкой, статистика матчей исправляется, коэффициенты закрытия появляются после события. Если обучить модель на «окончательных» версиях данных, она незаметно подсмотрит в будущее.
Профессиональная привычка — у каждого признака хранить метку времени доступности: timestamp публикации, задержку источника, дату последнего обновления. Для каждого прогноза собирается срез «как было на момент T»: только строки, опубликованные до T. Это называется point-in-time discipline, и именно она отделяет исследование от самообмана.
Второй аспект — происхождение данных. Любой источник имеет лицензию, задержку, политику исправлений и историю сбоев. Аналитик документирует все четыре свойства. Дешёвый источник с честной историей ошибок ценнее дорогого «чёрного ящика», потому что позволяет оценить, какой шум заложен в модель уже на входе.
ДИСЦИПЛИНА POINT-IN-TIME

Обучающий набор для прогноза события в момент T включает только наблюдения с меткой доступности не позже T. Всё, опубликованное позже, для этого прогноза не существует.
Кейс: «утёкший» состав
Модель предсказывала результативность фаворита с фантастической точностью: log loss на истории выглядел лучше рыночного. Разбор показал причину: в обучающей выборке стояли стартовые составы из официального протокола — документа, публикуемого после матча, но датированного часом начала. Модель честно «узнавала» из будущего, выйдет ли травмированный форвард. После замены составов на пресс-конференции за день до игры точность упала ниже базовой линии. Вывод не «модель плохая», а «предыдущая оценка была измерением утечки, а не сигнала». Практический тест на утечку: спросите по каждому признаку, могли ли вы получить его значение в момент прогноза, заплатив обычную цену и подождав обычную задержку источника. Если нет — признак отклоняется.
ТИПИЧНЫЕ ОШИБКИ
✗ Использовать «финальную» версию статистики вместо версии, опубликованной до события.
✗ Игнорировать время появления коэффициентов: цена закрытия недоступна до закрытия.
✗ Не фиксировать источник и его историю исправлений — шум входа прячется в модель.
ЗАДАНИЕ
Возьмите свой текущий набор признаков и выпишите для каждого: источник, момент публикации относительно начала события, типичную задержку, случаи ретроактивных исправлений. Отметьте признаки, которые не проходят point-in-time проверку, и переведите их в раздел «вспомогательная аналитика, не для обучения».
Вопросы для самопроверки
1. Что такое point-in-time discipline и почему без неё бесполезен любой backtest?
2. Приведите два примера данных, которые чаще всего «текут из будущего».
3. Какие четыре свойства источника данных документирует аналитик?
1.3. Вероятность: язык профессии
Вероятность — единственная валюта, в которой аналитик сравнивает свои суждения с чужими. Фраза «команда сильнее» непроверяема; фраза «победа хозяев с вероятностью 0.58» проверяема статистически: на большом числе похожих оценок примерно 58 % событий должны заканчиваться победой. Это свойство называется калибровкой и является первым критерием осмысленности любой модели.
Фундаментальное свойство монетной (и спортивной) неопределённости: одиночное событие не может ни подтвердить, ни опровергнуть вероятность. Если вы оценили шансы 70 на 30 и случилось «30» — это не ошибка, это реализация хвоста распределения. Выводы делаются только по частотам больших выборок и по совокупным метрикам: Brier score, log loss, reliability-кривой.
Поэтому профессиональный словарь заменяет «уверен/не уверен» на «модель даёт 0.64 при историческом Brier 0.21 на 3 000 событий». Такая фраза содержит оценку, меру её качества и размер доказательной базы — всё, что нужно для рабочего решения.
ЭМПИРИЧЕСКАЯ ПРОВЕРКА КАЛИБРОВКИ

Разбиваем прогнозы на корзины по уровню вероятности; внутри корзины из n событий наблюдаемая частота должна совпадать со средней оценкой в пределах статистического шума.
Кейс: «60 %» на практике
Модель выдала за сезон 400 прогнозов с оценками в диапазоне 0.55–0.65. Средняя оценка в корзине — 0.60, наблюдаемая доля успехов — 0.545. Стандартная ошибка при n = 400 равна √(0.6·0.4/400) ≈ 0.0245; отклонение 0.055 — чуть больше двух стандартных ошибок. Это повод перепроверить калибровку, но не повод объявлять модель сломанной: две сигмы случаются у честных моделей примерно раз в двадцать проверок. На встречной выборке из 1 200 событий отклонение сократилось до 0.012 — предположение о систематическом смещении не подтвердилось. Урок: решения о перестройке модели принимаются на выборках, где шум мал по сравнению с эффектом, а не на эмоциях от одной неудачной корзины.
ТИПИЧНЫЕ ОШИБКИ
✗ Оценивать качество вероятности по одиночному событию — по определению невозможно.
✗ Выдавать точечную оценку без указания выборки, на которой измерено её качество.
✗ Считать «высокую вероятность» синонимом «обязательно произойдёт».
ЗАДАНИЕ
Выберите любой свой исторический массив прогнозов (или котировки закрытия как их замену). Постройте reliability-таблицу: разбейте оценки на корзины 0–0.1, 0.1–0.2, …, посчитайте в каждой среднюю оценку, фактическую частоту и размер корзины. Отметьте корзины, где отклонение больше двух стандартных ошибок.
Вопросы для самопроверки
1. Почему одиночное событие не проверяет вероятность?
2. Что такое калибровка и как её проверить на корзинах?
3. Какие три числа должен содержать профессиональный ответ о прогнозе?
1.4. Benchmark: без базовой линии нет результата
Любая модель всего лишь доказывает, что она лучше выбранной альтернативы. Поэтому прежде, чем строить «умную» систему, аналитик фиксирует baseline — простое воспроизводимое правило, которое обязана обыгрывать любая серьёзная методика. Без зафиксированной базовой линии цифра качества не интерпретируется: Brier 0.21 — это хорошо или плохо? Ответ существует только относительно конкурента.
В спортивной аналитике иерархия базовых линий примерно такова: (0) частота класса в обучающей истории («дома побеждают в 46 % случаев»); (1) рейтинг-команды без учёта контекста (Elo с фиксированными параметрами); (2) рыночная цена без маржи (devig closing). Обойти уровень (0) — проверка адекватности кода. Обойти (1) — доказательство, что признаки несут информацию. Обойти (2) на дистанции — уже претензия на реальную ценность, и она требует строжайшей проверки на утечки.
Важно зафиксировать baseline до начала эксперимента и не менять его задним числом. Если выбранный конкурент оказался слишком слабым или слишком сильным — это отдельное наблюдение, а не повод молча подменить линейку.
СКИЛЛ-СКОР ОТНОСИТЕЛЬНО BASELINE

Для метрик типа Brier или log loss: положительный скилл означает, что модель лучше базовой линии; ноль — паритет; отрицательный — модель хуже тривиального правила.
Кейс: победа над слабым соперником
Исследователь обучил градиентный бустинг и получил log loss 0.94, отчитавшись об «улучшении на 3 %». Выяснилось, что базовой линией служила частота исходов домашних побед за пять сезонов (log loss 0.97). Однако котировки закрытия после удаления маржи давали на той же выборке log loss 0.90 — то есть «умная» модель проигрывала рынку 4 %. Правильный вывод из эксперимента: признаки системы на тот момент не содержали информации сверх рыночной цены. Это не провал работы — отрицательный результат надёжнее ложноположительного: он останавливает вложения в бесперспективное направление. Рабочее правило: отчёт о качестве модели всегда двухстрочный — «модель против простого baseline» и «модель против рыночного benchmark». Одной цифрой качество не описывается.
ТИПИЧНЫЕ ОШИБКИ
✗ Сравнивать модель с заведомо слабой линейкой и выдавать это за силу сигнала.
✗ Менять baseline после того, как увиден результат (rationalization).
✗ Отчитываться одной метрикой без указания, относительно кого она измерена.
ЗАДАНИЕ
Для вашей текущей задачи выпишите трёхуровневую лестницу baseline: тривиальный (частоты), средний (простой рейтинг), рыночный (devig closing price). Укажите, какую метрику будете сравнивать на каждом уровне и какой размер выборки нужен, чтобы различие в 1 % метрики было статистически различимо.
Вопросы для самопроверки
1. Зачем фиксировать baseline до начала эксперимента?
2. Опишите трёхуровневую иерархию базовых линий в спортивной аналитике.
3. Что доказывает и что не доказывает скилл-скор +3 % относительно частот исходов?
1.5. Процесс решения: от гипотезы до вывода
Профессиональный процесс — это конвейер, в котором каждый узел зафиксирован до знакомства с результатом: формулировка гипотезы → определение момента доступности данных → выбор baseline → временной разрез выборки → обучение/настройка на прошлом → единственная проверка на будущем (out-of-sample) → экономическая оценка → решение о дальнейшей судьбе сигнала. Последовательность важнее узлов: она защищает от главной профессиональной опасности — построить объяснение после известного исхода.
Дисциплина предрегистрации: гипотеза фиксируется письменно до теста вместе с условиями фальсификации («сигнал считается мёртвым, если скилл-скор против devig на 1 000 новых событий не превысит 0»). Предрегистрация превращает исследование в эксперимент: любой исход становится информативным, а не только победный.
Отдельный узел — экономика. Статистически значимый сигнал может не покрывать маржу, ограничение ликвидности (низкий максимум ставки), проскальзывание цены или операционные издержки. Поэтому экономический блок считается после статистики, но до любого практического вывода.
Кейс: гипотеза «домашний недооценённый андердог»
Предрегистрация: вселенная — домашние команды с ценой победы выше 3.50; признаки — разность xG за 10 матчей и отдых; тест — сезон-2024, обучение на 2019–2023; метрика — ROI по флэту и Brier против devig; условие провала — отрицательный скилл или ROI ниже −5 %. Тест показал ROI −2.1 % при скилл-скоре +0.4 %: слабый статистический след, но после маржи экономики нет. По заранее записанному правилу гипотеза архивируется с пометкой «неэкономично при текущей марже», и команда идёт дальше — без попыток «подкрутить» фильтры, пока цифра не станет красивой. Именно здесь процесс отличается от хобби: заранее записанное условие провала исполняется так же неукоснительно, как и условие успеха.
ТИПИЧНЫЕ ОШИБКИ
✗ Тестировать гипотезу и формулировать выводы на одной и той же выборке.
✗ Не записывать условия фальсификации — тогда гипотеза неуязвима и бесполезна.
✗ Считать статистику и экономику одним шагом: сначала правда о сигнале, потом правда о деньгах.
ЗАДАНИЕ
Возьмите одну гипотезу из своего списка и оформите карточку предрегистрации: формулировка, вселенная событий, момент доступности данных, baseline, обучающий и тестовый периоды, метрика, условие провала. Подпишите датой и сохраните в неизменяемом виде до окончания теста.
Вопросы для самопроверки
1. Перечислите узлы профессионального конвейера решения.
2. Что даёт предрегистрация и почему нельзя менять её задним числом?
3. Почему экономическая оценка идёт после статистической, а не вместо неё?
1.6. Ошибки мышления: как аналитик обманывает себя сам
Самый состоятельный аналитик проигрывает не нехватке методов, а встроенным искажениям. Hindsight bias: после известного результата история «на ходу» переписывается — закономерность кажется очевидной, хотя до матча сигналов было десятки в обе стороны. Confirmation bias: ищутся подтверждающие примеры, а контрпримеры помечаются «исключениями». Selection bias: обсуждаются стратегии, дожившие до публикации; тысячи умерших в репозитории не попадают.
Отдельная группа — статистические ловушки. Data dredging: перебор сотен правил гарантирует, что какое-то пройдёт любой порог случайно (подробнее — модуль 3). Overfitting на шуме: сложная модель идеально описывает прошлое ровно настолько, насколько бесполезна в будущем. Регрессия к среднему: «серия из пяти побед» без сигнала возвращается к среднему сама, и стратегия «покупать на подъёме» систематически покупает на пике.
Противоядие — не сила воли, а структура: предрегистрация против hindsight, обязательный список контрпримеров против confirmation, временные разрезы против утечек, поправки на множественные сравнения против перебора, post-mortem культуры — чтобы ошибки превращались в институциональную память, а не в повторяющийся налог.
Кейс: триумф подтверждения
Исследование «домашних фаворитов после поражения» собрало 40 подтверждающих примеров и выглядело убедительно. Проверка полной вселенной нашла 310 событий правила; подтверждающие примеры составили типичную хвостовую долю, а ROI полной совокупности был −6 %.

ТИПИЧНЫЕ ОШИБКИ
✗ Верить, что дисциплина заменяет методику: искажения побеждаются процедурой, а не характером.
✗ Считать сложную модель защитой от шума — она лишь находит его элегантнее.
✗ Оценивать стратегию по опубликованным историям успеха, игнорируя молчащее большинство.
ЗАДАНИЕ
Проведите ревизию своих последних десяти выводов: для каждого отметьте, какие искажения могли повлиять на формулировку, и какой структурный приём (предрегистрация, полная выгрузка, поправка на перебор) нейтрализовал бы риск. Два вывода с самым слабым обоснованием — переделать по-настоящему.
Вопросы для самопроверки
1. Чем hindsight bias отличается от простой ошибки памяти?
2. Почему перебор правил гарантированно находит «успешное»?
3. Как функция post-mortem превращает ошибку в актив команды?