Tarificacion

Del GLM al gradient boosting: machine learning en la tarificacion

Un recorrido por la evolucion de la tarificacion de seguros de daños, desde el GLM como estandar hasta el gradient boosting, sin perder de vista la interpretabilidad y el marco actuarial.

Act. Frank Ruiz de la Peña Olea 7 min de lectura 14 de julio de 2026 Artículo 2 de 10

La tarificacion de seguros de daños ha vivido una transformacion silenciosa pero profunda. De las tablas y factores construidos casi a mano, pasamos a modelos estadisticos formales y, en años recientes, a algoritmos de machine learning capaces de capturar interacciones que ningun actuario codificaria manualmente. Entender ese arco ayuda a usar cada herramienta en su lugar.

Breve historia de la tarificacion

En sus origenes, tarificar era en buena medida un ejercicio de segmentacion por celdas: se agrupaban riesgos por caracteristicas observables y se calculaba una prima promedio por grupo. El metodo era transparente, pero sufria cuando las celdas se vaciaban o cuando multiples factores interactuaban. La necesidad de un marco que estimara el efecto simultaneo de varias variables abrio la puerta a la estadistica formal.

El GLM como estandar

El modelo lineal generalizado (GLM) se consolido como el estandar de la industria por buenas razones. Permite modelar la frecuencia de siniestros, tipicamente con una distribucion Poisson, y la severidad, con una distribucion Gamma, mediante una funcion liga que conecta el predictor lineal con la media. La forma general es $g(\mu) = \beta_0 + \beta_1 x_1 + \cdots + \beta_p x_p$, donde $g$ es la funcion liga.

La liga logaritmica es especialmente comoda en seguros porque convierte los coeficientes en factores multiplicativos: cada variable ajusta la prima base por un factor, lo que resulta intuitivo y facil de comunicar a suscriptores y reguladores. El GLM ofrece coeficientes interpretables, intervalos de confianza y una teoria estadistica solida. La Casualty Actuarial Society (CAS) ha impulsado durante años literatura y examenes que hicieron del GLM el lenguaje comun de la tarificacion moderna.

Regularizacion: Ridge y Lasso

Cuando el numero de variables crece, el GLM clasico puede sobreajustar o volverse inestable ante la colinealidad. La penalizacion aparece como remedio. La regresion Ridge añade una penalizacion sobre la suma de cuadrados de los coeficientes, del tipo $\lambda \sum_j \beta_j^2$, que encoge los coeficientes y estabiliza la estimacion. La regresion Lasso penaliza la suma de valores absolutos, $\lambda \sum_j |\beta_j|$, con la virtud adicional de llevar algunos coeficientes exactamente a cero, lo que realiza una seleccion de variables automatica. Ambas conservan la interpretabilidad del GLM mientras controlan la complejidad.

Arboles y ensambles

Los arboles de decision ofrecen una logica distinta. En lugar de imponer una forma funcional, dividen el espacio de riesgos en regiones mediante cortes sucesivos sobre las variables. Un solo arbol es intuitivo pero inestable y propenso al sobreajuste. La respuesta fueron los ensambles: combinar muchos arboles para obtener predicciones mas robustas.

Dos familias dominan. El bagging, del que el random forest es el ejemplo mas conocido, entrena muchos arboles sobre muestras remuestreadas y promedia sus resultados, reduciendo la varianza. El boosting, en cambio, construye los arboles de forma secuencial, donde cada nuevo arbol corrige los errores del conjunto anterior.

Gradient boosting

El gradient boosting lleva esa idea a su expresion mas potente. La tecnica ajusta cada arbol nuevo al gradiente de una funcion de perdida respecto de las predicciones actuales, avanzando paso a paso hacia el minimo. Implementaciones como XGBoost y LightGBM lo hicieron rapido, escalable y capaz de manejar grandes volumenes de datos con muchas variables.

Para la tarificacion, su atractivo es evidente: captura interacciones y no linealidades que un GLM solo modela si el actuario las especifica a mano. En numerosos ejercicios comparativos, un modelo de gradient boosting bien afinado supera el desempeño predictivo de un GLM, particularmente cuando existen relaciones complejas entre las caracteristicas del riesgo.

Como se integran en seguros de daños

La adopcion practica rara vez es un reemplazo total. Surgen enfoques hibridos y complementarios.

El costo de la potencia: interpretabilidad

El poder predictivo del gradient boosting trae un costo: la opacidad. Un ensamble de cientos de arboles no ofrece coeficientes limpios que explicar a un regulador o a un asegurado que reclama por que su prima subio. En seguros, donde la equidad y la no discriminacion son exigencias legales y eticas, esa opacidad es un riesgo real.

Por eso ha florecido el campo de la interpretabilidad. Los valores de Shapley, provenientes de la teoria de juegos, permiten atribuir a cada variable su contribucion a una prediccion individual. Las graficas de dependencia parcial muestran el efecto marginal de una variable sobre la prima. Estas herramientas hacen posible auditar un modelo complejo sin renunciar a su desempeño.

Una evolucion, no una ruptura

El camino del GLM al gradient boosting no es la historia de una tecnica que destrona a otra, sino la de un instrumental que se amplia. El GLM sigue siendo insustituible por su transparencia y su encaje regulatorio; el gradient boosting aporta precision donde la complejidad lo justifica. El buen actuario de tarificacion no elige un bando: elige la herramienta correcta para cada problema y responde siempre por la equidad y la solvencia detras del numero.

TarificacionActuaríaInteligencia Artificial
‹ Anterior
La convergencia del actuario y el cientifico de datos
Siguiente ›
Redes neuronales para proyectar la mortalidad
FR

Act. Frank Ruiz de la Peña Olea

Actuario acreditado ante la CNSF. Especialista en seguros, pensiones, inversiones y reaseguro. Ver perfil completo

‹ Volver al blog

Explora la intersección Actuaría × IA

Profundiza en las bases estadísticas, el machine learning y las redes neuronales aplicadas al riesgo en la sección Actuar.IA.

Ir a Actuar.IA