predictionsОригинальные исследования AgentMMA

Как на самом деле работает ИИ-модель прогнозов UFC?

Как ИИ-модель прогнозов UFC превращает историю бойцов в вероятности победы, избегает утечки данных, проверяет точность и учитывает неопределённость.

Oscar Nascimento
Автор: Oscar Nascimento
Проверено: AgentMMA Editorial Team
9 мин чтения
Как на самом деле работает ИИ-модель прогнозов UFC?
Читать на:EnglishEspañolҚазақшаPortuguêsРусский

Краткий ответ

ИИ-модель прогнозов UFC находит закономерности в уже состоявшихся боях и сравнивает предбоевые данные: возраст, размах рук, недавние результаты, темп ударов и показатели тейкдаунов. Затем модель оценивает вероятность победы каждого бойца, а хорошая система строит каждый признак только по информации, доступной до боя. Её тестируют на более поздних боях, а не на случайной смеси старых и новых. Результат модели — вероятность, а не сценарий, по которому обязан пройти бой.

Данные в цифрах: магистерская работа Тилбургского университета 2021 года создала 35 предбоевых признаков. Итоговый набор включал 3,925 боёв UFC за период с октября 1998 года по сентябрь 2020-го. Проект Стэнфордского университета 2019 года проверил 134 признака на 3,355 боях с полными данными за 1997-2019 годы.

Что прогнозирует ИИ-модель боёв UFC?

Самая простая модель отвечает на один вопрос: кто победит? Она рассматривает задачу как бинарную классификацию: боец A получает одну метку класса, боец B — другую.

Итоговая метка скрывает самую полезную часть, а вероятностный классификатор выдаёт число от 0 до 1 либо его можно откалибровать для такой выдачи. После правильной калибровки 0.70 должно означать 70% вероятности победы, но это не значит, что боец выиграет семь раундов из десяти. Смысл в том, что бойцы с похожим прогнозом должны побеждать примерно в семи из каждых десяти сопоставимых случаев.

Откуда ИИ для прогнозов UFC берёт данные?

UFC Stats даёт полезную открытую основу: на страницах турниров есть результаты боёв и статистика по раундам — удары, тейкдауны, попытки сабмишенов и контроль. Страницы бойцов добавляют рост, размах рук, стойку и сводные данные за карьеру.

Сырые страницы ещё не образуют таблицу для обучения; каждая строка должна описывать один бой в один зафиксированный момент. В ней нужны профили двух бойцов и результат, который станет меткой класса.

Время данных важнее размера файла: допустим, вы восстанавливаете профиль Ислама Махачева перед защитой титула на UFC 330 против Иэна Мачадо Гарри. Официальная страница турнира UFC указывает, что бой за титул в полусреднем весе пройдёт 15 августа 2026 года.

Текущие данные профилей можно включить в прогноз, но результат боя нельзя, как и любую статистику, полученную во время этого боя.

Полезные данные часто делятся на четыре группы:

  • Физические параметры: возраст, рост, размах рук, стойка и весовая категория.
  • Результаты: предыдущие победы, поражения, серии, уровень соперников и время с прошлого боя.
  • Ударная техника: темп, точность, защита, нокдауны и косвенные показатели урона.
  • Грэпплинг: попытки тейкдаунов, точность, защита, контроль и попытки сабмишенов.

Травмы и тяжёлая весогонка могут влиять на исход, но их трудно моделировать, потому что последовательные исторические записи встречаются редко. Числовой столбец, собранный по слухам, способен лишь добавить шум.

Как сырая статистика боёв превращается в признаки модели?

Признак — это измеримый входной параметр, известный до составления прогноза; модели часто кодируют пару через разницы между бойцами, а не через два отдельных блока профильных данных.

Для боя Махачева с Гарри строка может содержать разницу в возрасте, размахе рук и числе тейкдаунов за 15 минут. Она также может сравнивать ударный баланс каждого бойца за три предыдущих боя в UFC, и эти различия показывают алгоритму, чем соперники отличаются друг от друга.

Средние показатели за карьеру требуют осторожности: у ветерана долгая история в UFC, а у дебютанта её нет. Если считать оба средних одинаково надёжными, большая разница в размере выборки пропадёт. Хороший процесс может добавить число боёв в UFC, подтянуть малые выборки к среднему по дивизиону или отметить пропущенные значения.

Для недавней формы тоже нужно фиксированное правило: вариант «последние три боя» даёт каждому бою одинаковый вес. Временное затухание может сильнее учитывать новые бои, но любой выбор нужно закрепить до тестирования.

Этап процессаВходные данныеРезультатГлавная ошибка, которую нужно исключить
СборОфициальные страницы боёв и бойцовСырые записи с датамиПропущенные или повторяющиеся бои
Восстановление историиБои до даты каждого поединкаПрофили бойцов, обновляемые во времениБудущие бои попадают в старые профили
Создание признаковДва предбоевых профиляРазницы, показатели и недавняя формаМалые выборки считаются надёжными
ОбучениеСтарые бои с известными победителямиОбученный классификаторЗапоминание имён или эпох
КалибровкаПрогнозы отдельной валидационной выборкиПригодные вероятности победыИзлишне уверенные прогнозы на 80%
ТестированиеБолее новые, ранее не использованные боиТочность и оценки качества вероятностейПовторное использование тестовой выборки при настройке

Какие алгоритмы машинного обучения подходят для прогнозов UFC?

Автоматического победителя здесь нет, но логистическая регрессия даёт понятную базовую модель. Случайный лес усредняет множество деревьев решений; градиентный бустинг исправляет ошибки предыдущих деревьев, а нейронные сети находят гибкие зависимости, но им нужно достаточно чистых данных.

Наборы данных по ММА малы по сравнению с обычными наборами изображений; сложная сеть может подогнать вчерашние бои, но не предсказать завтрашние.

Тургут обучил случайный лес и нейронную сеть на одном наборе из 3,925 строк; на тесте без утечки данных их точность составила 58.98% и 59.11%. Разница в 0.13 процентного пункта не доказывает, что нейросеть лучше понимала ММА.

В проекте Маккинли Маккуэйда для Стэнфорда использовались временные блоки по 3,355 боям с полными данными. Градиентный бустинг стал лучшим из четырёх методов со средней тестовой точностью 61.226%; дерево решений достигло 60.252%, а два других метода показали около 58%.

Цзяцзе Инь сравнил шесть методов на данных мужских боёв из 7,515 записей по май 2024 года, а метод большинства голосов достиг 65.52%. Результаты отдельных моделей находились в диапазоне от 59.13% до 63.99%; в статье не было чёткого описания хронологической отложенной выборки, поэтому напрямую сравнивать её показатель нельзя.

Эти результаты не задают потолок для любой системы, но показывают, почему название алгоритма менее важно, чем чистые признаки и честный тест.

Как на самом деле работает ИИ-модель прогнозов UFC?

Почему утечка данных — главный тревожный сигнал?

Утечка данных означает, что модель получает информацию, которой не было в момент прогноза, а в ММА она часто проникает через средние показатели за карьеру.

Представьте, что вы прогнозируете бой 2015 года по доле сабмишенов за карьеру, рассчитанной после более поздних боёв; такой признак незаметно включает несколько лет будущих данных. Модель смотрит назад, обладая знаниями, которых не могло быть у реального прогноза.

Тургут проверил это напрямую: чистый случайный лес показал 58.98% на тестовой выборке. Версия с утечкой достигла 65.11%, а чистая нейронная сеть набрала 59.11%, тогда как версия с утечкой — 68.59%.

Модель ТургутаТочность чистого тестаТочность теста с утечкойЗавышение
Случайный лес58.98%65.11%6.13 процентного пункта
Нейронная сеть59.11%68.59%9.48 процентного пункта

Этот скачок появился не благодаря более умному анализу боёв, а из-за запрещённой информации из будущего.

Случайное разделение боёв создаёт похожую проблему: в обучении могут оказаться бои спортсмена за 2024 год, а в тесте — его бой 2021 года. Упорядоченное разделение не даёт обучаться на будущем и тестироваться на прошлом.

Честный бэктест обучает модель на старых боях, настраивает её на более позднем блоке и один раз оценивает на самой новой нетронутой выборке. Скользящие тесты ещё лучше, поскольку они имитируют повторные прогнозы по мере появления новых турниров.

Как измерять точность прогнозов UFC?

Точность считает верно выбранных победителей, и её легко понять, но одной точности мало. Модель с каждым прогнозом на 51% и модель с прогнозами на 90% могут показать одинаковую точность.

Качество вероятностей нужно проверять отдельно, а log loss наказывает за уверенные ошибки. Показатель Брайера измеряет квадрат ошибки между каждым прогнозом и результатом; графики калибровки группируют похожие прогнозы и сравнивают их с фактической долей побед.

Если модель выдаёт 100 прогнозов около 70%, при достаточно большой выборке должны выиграть примерно 70 бойцов, а если побеждают лишь 55, модель слишком уверена. Scikit-learn предупреждает, что для калибровки нужны данные, отдельные от выборки для обучения классификатора.

Полезный отчёт показывает:

  • Точность на хронологической отложенной выборке.
  • Log loss или показатель Брайера для качества вероятностей.
  • Калибровку по диапазонам вероятности.
  • Результаты по дивизионам и уверенности прогноза с указанием размера выборок.

Рыночные коэффициенты могут стать ещё одним ориентиром, если зафиксированы их источник и время; превзойти подбрасывание монеты недостаточно, если простое правило выбора фаворита работает лучше. Совпадение с рынком не доказывает наличия преимущества в ставках, ведь цена, лимиты и движение линии — отдельные вопросы.

Как модель разбирает реальный бой?

Начнём с запланированного титульного боя Махачева и Гарри. Страница UFC Stats даёт рекорд и карьерные показатели каждого бойца. Модель фиксирует эти числа на дату прогноза.

Затем она восстанавливает меняющиеся во времени признаки. Можно сравнить размах рук и ударный темп Гарри с частотой тейкдаунов и защитными показателями Махачева. Пятираундовый формат тоже можно учесть, потому что титульные бои отличаются от стандартных трёхраундовых.

Модель пропускает разницы признаков через выученные решения. Одно дерево может реагировать на защиту от тейкдаунов. Другое может сочетать возраст, темп и размах рук. Их оценки объединяются, а затем калибруются.

Допустим, модель выдаёт 0.64 на одну из сторон. Это число описывает неопределённость модели, а не обещанный результат, и не объясняет каждый тактический путь.

Человек может заметить устаревшую заявку, неверную весовую категорию или подтверждённую позднюю замену. Он не должен менять вероятность лишь из-за собственного предчувствия. Любую корректировку нужно записывать и проверять.

Насколько надёжны эти данные?

UFC Stats ведёт последовательную открытую статистику, но охватывает не всё, что происходит в бою. Записанные действия не передают намерения, финты, боль, травму или решения угловых. Карьерные показатели также смешивают разных соперников, эпохи и состояния боя.

В исследованиях Стэнфорда и Тилбурга использовались 3,355 и 3,925 боёв с полными данными. Работа Иня 2024 года собрала 7,515 записей о боях, а затем ограничила прогнозирование мужскими поединками. Итоговый размер выборки для прогнозов в ней чётко не указан.

По состоянию на 26 июля 2026 года в действующей базе AgentMMA было 4,480 бойцов UFC за всю историю. Это охват ростера, а не 4,480 меток исхода. Число бойцов и число боёв отвечают на разные вопросы.

Сохраняется систематическая ошибка отбора. Бойцы UFC уже представляют элитную отобранную группу. Матчмейкинг не случаен, а бои на коротком уведомлении создают неравные условия подготовки. Дивизионы также отличаются темпом и частотой досрочных исходов.

Опубликованную точность нельзя честно сравнивать, если наборы данных, временные разбиения и метки не совпадают. Результат 65% с утечкой слабее более низкого результата на настоящей будущей выборке. Самая надёжная модель публикует журнал прогнозов до боёв и не скрывает ошибки.

Частые вопросы

Может ли ИИ точно прогнозировать бои UFC?

ИИ способен находить полезные закономерности, но исходы боёв UFC остаются неопределёнными. Открытые исследования показывают разные тестовые результаты в зависимости от данных и метода. Относитесь к любому высокому показателю осторожно, пока не увидите временное разбиение, признаки, базовый ориентир и полный журнал прогнозов.

Какие данные использует модель прогнозов UFC?

Модель прогнозов UFC может учитывать возраст, размах рук, стойку, весовую категорию, прошлые результаты, длину простоя, ударные показатели и показатели грэпплинга. Каждое значение должно отражать только информацию, доступную до прогнозируемого боя. Подтверждённый формат боя и поздняя замена тоже могут помочь, если их записывают последовательно.

Что такое утечка данных в машинном обучении для UFC?

Утечка данных возникает, когда модель использует будущую или послематчевую информацию для прогноза более раннего боя. Частые примеры — средние показатели за всю карьеру, более поздние рекорды или обработка сразу всего набора данных. Утечка может завысить заявленную точность, не улучшив реальные прогнозы.

Гарантирует ли вероятность победы 70% успех?

Нет. Прогноз 70% всё равно оставляет сопернику 30% шанса. В откалиброванной модели похожие прогнозы на 70% должны сбываться примерно семь раз из десяти на большой выборке. Любой отдельный бой может оказаться одним из оставшихся трёх.

Означает ли более высокая точность прибыльные ставки?

Нет. Точность не учитывает цену каждого выбора. Модель может верно выбирать много явных фаворитов, но не давать ценности по доступным коэффициентам. Анализ ставок также требует подразумеваемой вероятности, времени фиксации линии, расходов и большой записанной выборки.

Источники и материалы

Рецензируемые исследования и первичные данные, на которых основан этот анализ.

  1. UFC Stats: fight and fighter data (ufcstats.com)
  2. UFC: UFC 330 event page (www.ufc.com)
  3. Turgut 2021: MMA prediction thesis (arno.uvt.nl)
  4. Stanford CS229: UFC outcome models (cs229.stanford.edu)
  5. Yin 2024: MMA outcome prediction (jjthehonest.github.io)
  6. scikit-learn: data leakage (scikit-learn.org)
  7. scikit-learn: probability calibration (scikit-learn.org)
  8. AgentMMA fighter database (agentmma.com)

Проверьте данные в деле

Сравните любых двух бойцов или посмотрите прогнозы нашего ИИ на ближайшие бои UFC.

Ещё из MMA Lab

Как на самом деле работает ИИ-модель прогнозов UFC? | AgentMMA