Un modelo de machine learning entrega un número: la prima esperada, la reserva central, la probabilidad de que un siniestro sea fraudulento. El actuario, en cambio, rara vez decide con un número solo. Su oficio consiste en acotar lo que puede salir mal, en poner un rango alrededor del pronóstico y en cuantificar la confianza que merece. Entre esos dos mundos, el punto que estima el algoritmo y el intervalo con garantías que exige la práctica, hay una brecha que la predicción conforme (conformal prediction) ayuda a cerrar.
El número sin intervalo
Los métodos actuariales clásicos nacen acompañados de su propia teoría de la incertidumbre. Un modelo lineal generalizado ofrece errores estándar; el método de Mack sobre el triángulo de siniestros produce un error de predicción; la teoría de la credibilidad pondera la experiencia según su varianza. El problema aparece cuando sustituimos esos modelos por un gradient boosting o una red neuronal. Ganamos capacidad predictiva, pero perdemos el intervalo: el algoritmo devuelve una cifra puntual, y la pregunta de cuánto puede desviarse queda sin respuesta formal.
Ignorar esa pregunta no es una opción para quien fija primas, calcula reservas o dimensiona capital. Una tarifa sin margen de error es una tarifa que no sabe cuándo puede resultar insuficiente. Por eso la cuantificación de la incertidumbre, y no solo la exactitud media, es un requisito profesional y no un lujo estadístico. El actuario que adopta modelos de caja negra sin recuperar ese intervalo entrega la mitad del trabajo.
Qué promete la predicción conforme
La predicción conforme es un marco que envuelve a cualquier modelo, sin importar si es un GLM, un bosque aleatorio o una red profunda, y lo convierte en un generador de intervalos con una garantía de cobertura demostrable. Fijado un nivel de error \(\alpha\), por ejemplo 10 por ciento, construye un conjunto \(C(x)\) que cumple
$$\mathbb{P}\big(Y \in C(X)\big) \ge 1-\alpha,$$y esa desigualdad se sostiene sin suponer una distribución de los datos, con una sola hipótesis: que los casos observados y el caso nuevo sean intercambiables, una condición apenas más débil que la de estar idénticamente distribuidos. No exige normalidad, ni varianza constante, ni que el modelo subyacente esté bien especificado. Es una propiedad de calibración, no de acierto: garantiza que el intervalo atrape al valor real con la frecuencia prometida, aunque el modelo interior sea mediocre.
Cómo se construye un intervalo
La variante más usada, la conforme dividida (split conformal), es sorprendentemente simple. Se aparta una porción de los datos como conjunto de calibración, ajeno al entrenamiento. Sobre cada caso de calibración se mide una puntuación de no conformidad, que para una regresión suele ser el error absoluto \(s_i = |y_i - \hat{f}(x_i)|\). El intervalo para un caso nuevo resulta de sumar y restar al pronóstico un cuantil empírico de esas puntuaciones:
$$C(x) = \Big[\hat{f}(x) - \hat{q},\ \hat{f}(x) + \hat{q}\Big], \qquad \hat{q} = \text{Cuantil}_{1-\alpha}\big(\{s_1,\dots,s_n\}\big).$$El procedimiento no reentrena nada y su costo de cómputo es despreciable. Su elegancia está en que la garantía depende del cuantil de los errores realmente observados, y no de un supuesto sobre la forma de la distribución del error. Variantes más finas, como la conforme adaptativa por cuantiles, permiten que el ancho del intervalo cambie según la región del espacio, de modo que los casos difíciles reciban bandas más amplias.
Dónde sirve en el trabajo actuarial
La utilidad aparece allí donde ya usamos modelos flexibles pero necesitamos comunicar rangos, no puntos:
- Tarificación: acompañar la prima pura estimada por un gradient boosting con una banda que revele en qué segmentos el modelo es más incierto.
- Reservas: añadir intervalos de predicción a los métodos de aprendizaje automático sobre triángulos, un lenguaje natural para el margen de riesgo bajo Solvencia II.
- Longevidad y pensiones: expresar la incertidumbre de una proyección de mortalidad como un rango de tasas, y no como una curva única y engañosamente precisa.
- Salud y alto costo: separar a los asegurados cuyo gasto es difícil de anticipar, señalados por intervalos anchos, de aquellos con pronóstico estable.
- Detección de anomalías: convertir la propia puntuación de no conformidad en una medida de rareza para priorizar la revisión de siniestros atípicos.
Las letras pequeñas
La garantía es real, pero conviene leer sus términos. La cobertura es marginal: se cumple en promedio sobre toda la cartera, no necesariamente dentro de cada subgrupo. Un intervalo puede cubrir el 90 por ciento a nivel global y quedarse corto en un segmento concreto, justo el tipo de brecha que preocupa a la equidad en la tarificación. Existen variantes condicionales y por grupos que atacan este punto, a costa de más datos y más complejidad.
La segunda letra pequeña es la intercambiabilidad. Cuando la cartera cambia con el tiempo, por inflación, por un cambio de mezcla o por un choque de siniestralidad, los datos dejan de ser intercambiables y la cobertura se degrada. La predicción conforme no es inmune a la deriva de datos: es una herramienta de calibración, no un seguro contra el futuro. El monitoreo continuo del modelo sigue siendo indispensable, tal como lo exige una gobernanza seria del riesgo de modelo.
La incertidumbre como criterio
Ninguna de estas advertencias resta valor a la idea central. Devolver un intervalo, y no un número desnudo, alinea la salida del algoritmo con la forma en que el actuario ha razonado siempre: en términos de riesgo, no de certeza. Cuerpos profesionales como la Society of Actuaries (SOA), la Casualty Actuarial Society (CAS) y el Institute and Faculty of Actuaries (IFoA) insisten en que la cuantificación de la incertidumbre y la validación de modelos forman parte del núcleo de la práctica, precisamente cuando los modelos se vuelven más opacos.
La predicción conforme no reemplaza el juicio profesional: lo alimenta. Le da al actuario un instrumento honesto para declarar, con respaldo formal, cuánto no sabe. Y en un oficio cuya materia prima es la incertidumbre, saber medir la propia ignorancia es, quizá, la habilidad más valiosa que la inteligencia artificial puede ayudarnos a recuperar.