Валерий Громов
Валерий Громов спрашивает:

Publicly available данные по футбольной статистике достаточны для построения краевой модели?

📁 Ставки на спорт 4 нед. назад 💬 5 ответов
Оцените этот вопрос:
3 / 5  (1 оценка)

5 ответов

Матвей Дорофеев
Матвей Дорофеев 6 38 4 нед. назад
Зависит от того, на какой уровень ты целишься. Если мы говорим о топ-лигах (АПЛ, Ла Лига, Серия А), то бесплатные данные с Opta через WhoScored или Understat дают базовый набор - удары, xG, владение, пасы. Этого хватит, чтобы заметить очевидные аномалии в линии, но для устойчивой краевой модели этого часто недостаточно. Букмекеры считают на порядок глубже, используя те же данные, плюс свои модели с тысячами переменных. Проблема не в отсутствии статистики, а в её разрешении - публичные данные редко дают контекст (например, качество соперника в конкретные отрезки матча или усталость игроков в динамике). Я бы сказал, что для построения модели с положительным ожиданием (EV) на дистанции публичных данных хватит, только если ты готов сузить фокус на нишевые рынки (статистика по угловым, жёлтым карточкам или индивидуальные показатели игроков), где букмекеры часто менее точны. В мейнстримных исходах (победа/ничья/поражение) без платных источников вроде Wyscout или StatsBomb ты почти наверняка будешь в минусе после учёта маржи.
11
Мастер Спинов
Мастер Спинов 8 23 4 нед. назад
Для низших дивизионов и маркетов типа «тотал угловых» или «жёлтые карточки» открытые данные часто перекрывают потребности. Проблема не в доступности, а в скорости - краевая модель требует подгрузки информации в реальном времени, а бесплатные источники вроде Flashscore задерживаются на 3-5 секунд.
5
Jackpot King
Jackpot King 6 30 4 нед. назад
Возьми конкретный пример - рынок «обе забьют» в матче Португалия - Турция. Публичные данные покажут, что у обеих команд высокий процент забитых голов в последних 5 играх, и линия букмекера будет на это реагировать. Но краевую модель можно построить не на средних цифрах, а на микро-паттернах: как часто команда пропускает после 75-й минуты, когда у нее удаление, или какой процент голов забивается со стандартов против конкретной схемы обороны. Эту статистику ты не вытянешь из Understat или FBref без ручного парсинга и чистки. Проблема не в том, что данных мало, а в том, что они неструктурированы для таких нюансов.
4
Геннадий Комаров
Геннадий Комаров 6 39 4 нед. назад
Смотря что считать достаточностью. Для одного-двух рынков вроде тотала голов в условной бельгийской лиге открытых данных с FotMob или Understat реально хватает, если чистить их руками и смотреть на дисперсию. Но проблема в том, что ты борешься с букмекером, который эти же цифры видит, но обрабатывает их быстрее и добавляет контекст - травмы, погоду, мотивацию. Край в таких условиях держится не на данных, а на неэффективности рынка: например, на недооценке команды, которая играет в три защитника после ухода тренера. Публичная статистика это не поймает, а букмекерская линия - уже нет.
4
Lucky Spin
Lucky Spin 7 34 4 нед. назад
С бесплатными данными ты поймаешь только очевидные перекосы в линии, которые чаще всего исчезают за 2-3 часа до матча. Проблема не в количестве метрик, а в их чистоте и глубине - публичные xG часто считаются по упрощенным алгоритмам, без учета угла удара, давления защитника и типа передачи. Букмекерские модели давно учитывают контекст: например, один и тот же xG при счете 0-0 и 3-0 весит по-разному. На дистанции твоя модель будет проигрывать марже из-за шума в данных, особенно в низших лигах, где публичная статистика вообще редкая. Если хочешь краевую модель без покупки Opta или StatsBomb, придется вручную чистить данные и вводить веса для устаревших матчей - это геморрой, но теоретически возможно.
3

Ответить

0 / 3000