predictionsInvestigación original de AgentMMA

Cómo funciona un modelo de IA para predecir peleas de UFC

Descubre cómo un modelo de IA para predecir peleas de UFC convierte datos históricos en probabilidades y evita fugas que inflan la precisión aparente.

Oscar Nascimento
Revisado por AgentMMA Editorial Team
11 min de lectura
Cómo funciona un modelo de IA para predecir peleas de UFC

Respuesta rápida

Un modelo de IA para predecir peleas de UFC aprende patrones de combates que ya ocurrieron. Compara datos previos al combate, como edad, alcance, resultados recientes, ritmo de golpeo y tasas de derribos. Después estima la probabilidad de victoria de cada peleador. Los buenos sistemas construyen cada variable solo con información disponible antes de esa pelea. Se prueban con combates posteriores, no con una mezcla aleatoria de eventos nuevos y antiguos. El resultado es una probabilidad, no un guion de lo que debe pasar.

Resumen de datos: una tesis de maestría de Tilburg University de 2021 creó 35 variables previas al combate. Su conjunto final reunió 3,925 peleas de UFC extraídas del periodo entre octubre de 1998 y septiembre de 2020. Un proyecto de Stanford de 2019 probó 134 variables en 3,355 peleas completas de 1997-2019.

¿Qué predice un modelo de IA para UFC?

El modelo más sencillo responde una pregunta: ¿qué peleador gana? Trata el problema como una clasificación binaria: el peleador A recibe una etiqueta y el peleador B recibe la otra.

Esa etiqueta final oculta la parte útil. Un clasificador probabilístico produce, o puede calibrarse para producir, una puntuación entre 0 y 1. Con una calibración correcta, 0.70 debería representar una probabilidad de victoria del 70%. No significa que el peleador ganará siete rounds de cada diez. Significa que peleadores con pronósticos similares deberían ganar cerca de siete de cada diez casos comparables.

¿De dónde obtiene sus datos una IA que predice peleas de UFC?

UFC Stats ofrece una base pública útil, y sus páginas de eventos registran resultados y datos por round sobre golpeo, derribos, sumisiones y control. Las páginas de los peleadores añaden estatura, alcance, guardia y resúmenes de carrera.

Esas páginas sin procesar todavía no forman una tabla de entrenamiento; cada fila debe representar una pelea en un momento determinado. Necesita los perfiles de ambos peleadores y el resultado que servirá como etiqueta.

El momento de captura importa más que el tamaño del archivo. Imagina que reconstruyes el perfil de Islam Makhachev antes de su defensa contra Ian Machado Garry en UFC 330. La página oficial del evento de UFC programa esa pelea por el título wélter para el 15 de agosto de 2026.

Los datos actuales del perfil pueden entrar en el pronóstico. El resultado no, ni tampoco ninguna estadística producida durante la pelea.

Los datos útiles suelen dividirse en cuatro grupos:

  • Contexto físico: edad, estatura, alcance, guardia y división.
  • Resultados: victorias, derrotas, rachas, calidad de rivales y tiempo desde la última pelea.
  • Golpeo: ritmo, precisión, defensa, knockdowns y medidas indirectas de daño.
  • Grappling: intentos de derribo, precisión, defensa, control e intentos de sumisión.

Las lesiones y los cortes de peso difíciles pueden influir, pero son complicados de modelar porque casi nunca existen registros históricos consistentes. Una columna numérica basada en rumores puede añadir ruido.

¿Cómo se convierten las estadísticas en variables del modelo?

Una variable es un dato medible conocido antes del pronóstico. Los modelos suelen representar el cruce mediante diferencias entre ambos peleadores, no con dos bloques de perfil separados.

Para Makhachev contra Garry, una fila podría incluir las diferencias de edad, alcance y derribos completados por cada 15 minutos. También podría comparar el diferencial de golpeo de cada uno durante sus tres peleas anteriores en UFC. Esas diferencias le indican al algoritmo qué separa a ambos.

Los promedios de carrera exigen cuidado. Un veterano tiene una larga trayectoria en UFC, mientras un debutante no tiene ninguna pelea allí. Tratar ambos promedios con la misma certeza oculta una gran diferencia de muestra. Un proceso bien diseñado puede añadir el número de peleas en UFC, acercar muestras pequeñas al promedio divisional o marcar valores ausentes.

La forma reciente también necesita una regla fija. “Últimas tres peleas” concede el mismo peso a cada combate. Una ponderación temporal puede dar más peso a los recientes. Cualquiera de las dos reglas debe fijarse antes de probar el modelo.

Etapa del procesoEntradaSalidaFalla principal que debe detectar
RecopilarPáginas oficiales de peleas y peleadoresRegistros sin procesar y fechadosPeleas ausentes o duplicadas
Reconstruir historialPeleas anteriores a la fecha de cada combatePerfiles acumulados de los peleadoresPeleas futuras dentro de perfiles antiguos
Crear variablesDos perfiles previos al combateDiferencias, tasas y forma recienteTratar muestras pequeñas como certezas
EntrenarPeleas antiguas con ganadores conocidosClasificador entrenadoMemorizar nombres o épocas
CalibrarPronósticos de una validación separadaProbabilidades de victoria utilizablesPronósticos del 80% demasiado confiados
ProbarPeleas nuevas no utilizadasPrecisión y métricas de probabilidadReutilizar la prueba mientras se ajusta

¿Qué algoritmos de aprendizaje automático funcionan para UFC?

No existe un ganador automático, aunque la regresión logística ofrece una referencia clara. Los bosques aleatorios promedian muchos árboles de decisión, mientras el gradient boosting corrige los errores de árboles anteriores. Las redes neuronales aprenden relaciones flexibles, pero necesitan suficientes datos limpios.

Los conjuntos de datos de MMA son pequeños frente a los comunes en visión por computadora. Una red complicada puede ajustarse a las peleas de ayer sin pronosticar las de mañana.

Turgut entrenó un bosque aleatorio y una red neuronal con el mismo conjunto de 3,925 filas. Sus precisiones de prueba, con control de fugas, fueron 58.98% y 59.11%. La diferencia de 0.13 puntos no muestra que la red neuronal entendiera mejor las MMA.

El proyecto de Stanford de McKinley McQuaide usó bloques temporales sobre 3,355 peleas completas. Gradient boosting lideró los cuatro métodos probados con 61.226% de precisión promedio. El árbol de decisión llegó a 60.252%, mientras los otros dos modelos rondaron el 58%.

Jiajie Yin comparó seis métodos con datos de peleas masculinas extraídos de 7,515 registros hasta mayo de 2024. La votación mayoritaria alcanzó 65.52%, mientras los modelos individuales quedaron entre 59.13% y 63.99%. El artículo no documentó con claridad una prueba cronológica, por lo que el resultado no es directamente comparable.

Estos resultados no fijan el techo de todos los sistemas. Sí muestran que la limpieza de las variables y una prueba honesta pesan más que el nombre del algoritmo.

Cómo funciona un modelo de IA para predecir peleas de UFC

¿Por qué la fuga de datos es la mayor señal de alerta?

Una fuga de datos ocurre cuando el modelo recibe información que no estaba disponible al pronosticar. En MMA, suele entrar mediante los promedios de carrera.

Imagina pronosticar una pelea de 2015 con una tasa de sumisiones calculada después de combates posteriores. Esa variable incluye en silencio varios años de evidencia futura. El modelo mira al pasado con información que ningún pronóstico real podía tener.

Turgut lo probó directamente: el bosque aleatorio limpio obtuvo 58.98% en la prueba. Su versión con fuga obtuvo 65.11%, mientras la red neuronal limpia marcó 59.11% y la versión con fuga llegó a 68.59%.

Modelo de TurgutPrecisión limpia en pruebaPrecisión con fugaInflación
Bosque aleatorio58.98%65.11%6.13 puntos porcentuales
Red neuronal59.11%68.59%9.48 puntos porcentuales

Ese salto no vino de un análisis más inteligente, sino de información futura que el modelo no debía conocer.

Dividir las peleas al azar crea un problema parecido. El entrenamiento podría incluir peleas de 2024 y luego probar una pelea de 2021 del mismo atleta. Los cortes cronológicos evitan entrenar con el futuro y evaluar con el pasado.

Un backtest justo entrena con peleas antiguas, ajusta con un bloque posterior y evalúa una vez sobre el bloque más nuevo. Las pruebas con ventanas móviles son aún mejores porque imitan pronósticos repetidos mientras llegan nuevos eventos.

¿Cómo debe medirse la precisión de un pronóstico de UFC?

La precisión cuenta ganadores acertados y es fácil de entender, pero está incompleta. Un modelo que asigna 51% a cada selección puede igualar la precisión de otro que asigna 90%.

La calidad de las probabilidades necesita controles separados, pues la pérdida logarítmica castiga los errores confiados. La puntuación de Brier mide el error cuadrático entre cada pronóstico y el resultado. Las gráficas de calibración agrupan pronósticos similares y los comparan con las tasas reales de victoria.

Si un modelo emite 100 pronósticos cercanos al 70%, unos 70 deberían acertar con una muestra bastante grande. Si solo ganan 55, el modelo tiene exceso de confianza. Scikit-learn advierte que la calibración necesita datos distintos de los usados para entrenar el clasificador.

Un informe útil muestra:

  • Precisión en un conjunto cronológico reservado.
  • Pérdida logarítmica o puntuación de Brier para medir las probabilidades.
  • Calibración por rango de probabilidad.
  • Resultados por división y nivel de confianza, con sus tamaños de muestra.

Las cuotas del mercado pueden servir como otra referencia si su fuente y hora de captura están fijadas. Acertar más que una moneda al aire no basta si una regla simple de favoritos funciona mejor. Aun así, igualar al mercado no prueba una ventaja para apostar. Los precios, límites y movimientos de línea son preguntas distintas.

¿Cómo procesa el modelo un enfrentamiento real?

Empieza con la pelea titular programada entre Makhachev y Garry. UFC Stats aporta el récord y las tasas de carrera de ambos, y el predictor congela esas cifras en la fecha del pronóstico.

Después reconstruye variables acumuladas. Puede comparar el alcance y ritmo de golpeo de Garry con la tasa de derribos y el registro defensivo de Makhachev. También puede incluir el formato de cinco rounds, porque las peleas titulares difieren de los combates normales a tres.

El modelo pasa esas diferencias por decisiones aprendidas, y un árbol puede responder a la defensa de derribos. Otro puede combinar edad, ritmo y alcance; después se combinan y calibran sus puntuaciones.

Supón que la salida fuera 0.64 para uno de los lados. Ese número describiría la incertidumbre del modelo, no un resultado prometido, y tampoco explicaría todas las rutas tácticas.

La revisión humana puede detectar una pelea que ya no está vigente, una división equivocada o un reemplazo tardío confirmado. No debería cambiar una probabilidad por la corazonada de un analista. Cualquier ajuste manual debe registrarse y ponerse a prueba.

¿Qué tan sólidos son estos datos?

UFC Stats es un registro público consistente, pero no captura cada aspecto de una pelea. Sus conteos describen acciones registradas, no intención, fintas, dolor, lesiones o decisiones del equipo. Las tasas de carrera también mezclan rivales, épocas y estados de pelea.

Los estudios de Stanford y Tilburg usaron 3,355 y 3,925 peleas completas. El artículo de Yin de 2024 recopiló 7,515 registros y luego limitó la predicción a peleas masculinas. No informó con claridad el tamaño final de la muestra predictiva.

La base en vivo de AgentMMA contenía 4,480 peleadores históricos de UFC el 26 de julio de 2026. Eso mide cobertura de plantel, no 4,480 etiquetas de resultados. El número de peleadores y la muestra de peleas responden preguntas diferentes.

El sesgo de selección sigue presente: los peleadores de UFC ya forman un grupo de élite seleccionado. El emparejamiento no es aleatorio y las peleas con poco aviso generan preparaciones desiguales. Las divisiones también difieren en ritmo y patrones de finalización.

Las precisiones publicadas no pueden compararse bien si cambian los datos, las divisiones temporales o las etiquetas. Un 65% con fuga vale menos que una cifra menor sobre una prueba futura real. El modelo más confiable publica su registro antes de las peleas y mantiene visibles los errores.

Preguntas frecuentes

¿La IA puede predecir peleas de UFC con precisión?

La IA puede encontrar patrones útiles, pero los resultados de UFC siguen siendo inciertos. Los estudios públicos han publicado cifras distintas según sus datos y métodos. Examina con cuidado cualquier cifra alta hasta ver la división temporal, variables, referencia y registro completo de pronósticos.

¿Qué datos utiliza un modelo de predicción de UFC?

Un modelo puede usar edad, alcance, guardia, división, resultados previos, tiempo de inactividad y tasas de golpeo y grappling. Cada dato debe reflejar solo información disponible antes de la pelea pronosticada. El formato confirmado y un reemplazo con poco aviso también pueden ayudar si se registran de forma consistente.

¿Qué es una fuga de datos en el aprendizaje automático para UFC?

Una fuga ocurre cuando el modelo usa información futura o posterior para pronosticar una pelea anterior. Los ejemplos comunes incluyen promedios de carrera completos, récords posteriores o procesamiento sobre todo el conjunto. La fuga puede inflar la precisión publicada sin mejorar los pronósticos en vivo.

¿Una probabilidad de victoria del 70% es una garantía?

No: un pronóstico del 70% todavía concede al rival un 30%. En un modelo calibrado, selecciones similares del 70% deberían ganar cerca de siete de cada diez veces. Una pelea concreta puede caer entre las otras tres.

¿Una mayor precisión significa que las apuestas serán rentables?

No: la precisión ignora el precio de cada selección. Un modelo puede acertar muchos favoritos claros sin ofrecer valor a las cuotas disponibles. El análisis de apuestas también exige probabilidad implícita, momento de captura de la línea, costos y una muestra registrada amplia.

Fuentes y lecturas

Estudios revisados por pares y datos primarios detrás de este análisis.

  1. UFC Stats: fight and fighter data (ufcstats.com)
  2. UFC: UFC 330 event page (www.ufc.com)
  3. Turgut 2021: MMA prediction thesis (arno.uvt.nl)
  4. Stanford CS229: UFC outcome models (cs229.stanford.edu)
  5. Yin 2024: MMA outcome prediction (jjthehonest.github.io)
  6. scikit-learn: data leakage (scikit-learn.org)
  7. scikit-learn: probability calibration (scikit-learn.org)
  8. AgentMMA fighter database (agentmma.com)

Pon los datos a trabajar

Compara a dos peleadores cara a cara o mira lo que predice nuestra IA para las próximas peleas de UFC.

Más del MMA Lab

Cómo funciona un modelo de IA para predecir peleas de UFC | AgentMMA