
15 Oct DISCOVERY: Comparativa de rendimiento de modelos de decisión/explicación
15/10/2024 –
En el proyecto DISCOVERY se ha realizado una comparativa para elegir el mejor modelo de decisión/explicación. ¿Cómo elegir el mejor modelo?
Cuando queremos hacer predicciones con datos, necesitamos modelos que sean precisos, robustos y, en la medida de lo posible, explicables. Existen muchos enfoques para lograrlo, pero no todos ofrecen el mismo equilibrio entre rendimiento e interpretabilidad. En esta comparativa, exploraremos dos de los modelos más avanzados y populares: Random Forest y Gradient Boosting.
Apoyo Financiero
Este proyecto tiene el apoyo financiero de la Unión Europea a través de los fondos Next Generation EU en el marco de la convocatoria de ayudas 2021 destinadas a proyectos de investigación y desarrollo en inteligencia artificial y otras tecnologías digitales y su integración en las cadenas de valor (C005/21-ED).




Modelos clásicos vs. Modelos avanzados
Los modelos clásicos como los árboles de decisión son muy apreciados por su facilidad de interpretación. Podemos visualizar su estructura y entender por qué han tomado una determinada decisión. Sin embargo, estos modelos suelen quedarse cortos en términos de rendimiento cuando enfrentamos problemas más complejos.
En contraste, modelos más avanzados como las redes neuronales o los modelos ensemble han demostrado ser más potentes en muchas tareas, aunque sacrifican interpretabilidad en el proceso. Aquí es donde entran en juego dos técnicas que buscan el equilibrio entre rendimiento y explicabilidad: Random Forest y Gradient Boosting.
¿Qué son Random Forest y Gradient Boosting?
Random Forest
Random Forest es un modelo ensemble, lo que significa que combina varios árboles de decisión para mejorar la precisión. En esencia, crea múltiples árboles y, en el caso de problemas de clasificación, decide el resultado final a partir de una votación por mayoría. En problemas de regresión, se hace un promedio de las predicciones.
Ventajas:
- Reduce el sobreajuste gracias a la combinación de múltiples árboles.
- Funciona bien con datos con muchas variables de entrada.
- Es relativamente fácil de interpretar comparado con otros modelos más complejos.
Desventajas:
- Puede ser computacionalmente costoso con grandes volúmenes de datos.
- No siempre alcanza el rendimiento máximo de modelos más sofisticados.
Gradient Boosting
Gradient Boosting es otro modelo ensemble, pero con una diferencia clave: en lugar de crear múltiples árboles independientes, construye los árboles de forma secuencial, aprendiendo de los errores del modelo anterior. Cada nuevo árbol intenta corregir los errores del anterior, lo que permite obtener predicciones más precisas.
Ventajas:
- Suele ofrecer un rendimiento superior en comparación con Random Forest.
- Es especialmente útil cuando se requiere alta precisión.
- Funciona bien con un gran número de variables.
Desventajas:
- Puede sobreajustarse si no se regula bien.
- Es más difícil de interpretar que Random Forest.
- Su entrenamiento es más lento debido a su naturaleza secuencial.
Comparación de rendimiento
Random Forest
- Con pocos atributos, el rendimiento era muy bajo.
- A medida que se añadían más atributos, el rendimiento mejoraba progresivamente.
- En la mayoría de los casos, alcanzó alrededor del 60% de precisión.
- Conclusión: Su desempeño está fuertemente ligado a la cantidad de atributos disponibles.
Gradient Boosting
- Su comportamiento fue similar a Random Forest en cuanto a la influencia del número de atributos.
- En general, ofreció mejor rendimiento, alcanzando en algunos casos el 100% de precisión en ciertos datasets.
Conclusión: Es una opción más potente si buscamos la máxima precisión, pero requiere una optimización más cuidadosa.