Как построить свою статистическую модель: от данных до прибыли

Похожие новости

Добавить комментарий

Автору будет очень приятно узнать обратную связь о своей новости.

Кликните на изображение чтобы обновить код, если он неразборчив

Комментариев 6

Viktoria_V Офлайн 5 января 2026 15:30
Viktoria_V

Помню, как в прошлом сезоне проиграл 800 рублей на "Севилье, Барселона". Просто верил в "бомбардиров", и не проверил, что у Севильи в том матче 4 игрока с дисквалификацией. Решил: хватит наугад. Беру 500 матчей, выгружаю статистику через API, чищу данные в pandas. Делал так: если у команды 3+ желтых карточки в последних 5 матчах, шансы на гол в первом тайме падают на 37%. Проверил, да, статистика не врет. Протестировал на 2019 году, потом на 2023. Прибыль выросла с 3% до 14%. И да, BetMaster88, ты прав, что начал с нормализации. Я же начал с кривой. Теперь не лезу в матчи с "желтыми" без проверки. Работает. )

--------------------

Удачи всем :) — Viktoria_V

BookieChoice Офлайн 5 января 2026 15:53

Viktoria_V, ты говоришь про 500 матчей и API, ну типичная ошибка. Я на своём опыте убедился: 80% данных из публичных API, ложь. Проверял на матче "Боруссия", "Арсенал" в 2023. В API было 2.4 гола в среднем на "Боруссию", на деле, 1.1. Проверял вручную по видео и счёту. Вывод: не доверяй "официальным" данным. Делал так: беру 100 матчей, загружаю вручную, смотрю каждый счёт, пересчитываю угловые, карточки. Потом уже в pandas. И да, нормализация, не просто "сделать min-max", а проверять дисперсию. У меня в одном из параметров, отклонение 3.7 стаднартных отклонений. Сразу варнинг. Покажи, как именно ты чистил данные. И кто это проверял? ))

--------------------

скептик по жизни ))

PuckMaster Офлайн 5 января 2026 16:00

BookieChoice, ты прав про API, проверял на 120 матчах "Премьер-лиги" 2023. В 7 из 10 случаев статистика отличалась от реальности на 0.3+ гола в среднем. Потом понял: не бери данные с одного источника. Собирал у 3 разных, сравнивал, фильтровал по расхождению. Если разница больше 0.2, удалял. Делал так: парсил через requests, смотрел на валидацию через реальные счёты. В итоге точность на 14% выше. Схема сбора данных у меня в блоге. Короче, доверяй, но проверяй…

EmotionalBet Офлайн 5 января 2026 16:47

PuckMaster, ты про 3 источника и фильтрацию, точно, без этого не выжать прибыль. У меня был такой же бардак: брал стату с сайта, где "голы в матче", и вдруг в 30% случаев разница с реальностью была больше 0.5. Потом понял: не просто сравнивать, а смотреть, откуда берется дисперсия. Нашел, что в 40% случаев "официальные" данные, это усредненная статистика с 1-2 минутами задержки, а у игроков в реалтайме все иначе. Убрал все источники, где не было публичного API с логами обновлений. Сейчас беру только те, где можно проверить, какая версия данных возвращается в 17:00 и в 23:00, если разница есть, удаляю.:) Пробовал на 200 матчах "Бундеслиги" 2023, результат вырос на 14% после фильтрации. Все, что не проходит проверку по времени и версии, не в модель.

--------------------

люблю когда люди делятся опытом ♥

Doubtful Офлайн 5 января 2026 16:35

Doubtful: PuckMaster, ты говоришь про фильтрацию по расхождению 0.2 в голах. Но как именно ты определяешь, какой источник, "правильный"? Потому что если у тебя три источника, а все три дают разные цифры, кто виноват? Или ты просто берешь среднее? а если один источник, вроде бы официальный, но в нём 1.1 гола, а по видео, 1.8? Тогда какое значение считать истиной? Надо конкретно, а не "фильтрую по расхождению". Покажи пример, как это работает в коде. Или это просто "посмотрел и решил"?

--------------------

из Ставки на спорт: Основы, если что

ProMaster Офлайн 5 января 2026 17:09

ProMaster, Viktoria_V, ты упомянул 500 матчей и API, но как именно вычищал данные? Конкретно: как определял, что «реальные» данные, не ложь, а правда? Сравнивал с видео? Или брал вручную из табличек с официального сайта? Спрашиваю, потому что у меня в 30% случаев API показывает 3 угловых, а в кадре, 5. Такое вроде мелочь, но если играешь на тотал больше 2.5, это разница между выигрышем и проигрышем

И еще: ты говорил про фильтрацию по расхождению. Какой порог использовал? 0.2, как у PuckMaster, или у тебя другая цифра? Хотелось бы понять, как ты это делал на практике, а не в теории.