Episodio
Optimización bayesiana con redes neuronales bayesianas sólidas
con Jost Tobias Springenberg
La optimización bayesiana es un método destacado para optimizar las funciones costosas de la caja negra que se aplican de forma destacada a la optimización de los hiperparámetros de los algoritmos de aprendizaje automático. A pesar de sus éxitos, el enfoque de optimización bayesiano prototíptico ( mediante modelos de procesos gaussianos) no se escala bien a muchos hiperparámetros o a muchas evaluaciones de funciones. Atacar esta falta de escalabilidad y flexibilidad es, por tanto, uno de los principales desafíos del campo. Presentamos un enfoque general para usar modelos paramétricos flexibles (redes neuronales) para la optimización bayesiana, que permanece lo más cerca posible de un tratamiento bayesiano verdaderamente. Obtenemos escalabilidad a través del gradiente estocástico Hamiltoniano Monte Carlo, cuya solidez mejoramos a través de una adaptación de escala. Los experimentos que incluyen la optimización bayesiana de varias tareas con 21 tareas, la optimización paralela de redes neuronales profundas y el aprendizaje de refuerzo profundo muestran la eficacia y flexibilidad de este enfoque.
La optimización bayesiana es un método destacado para optimizar las funciones costosas de la caja negra que se aplican de forma destacada a la optimización de los hiperparámetros de los algoritmos de aprendizaje automático. A pesar de sus éxitos, el enfoque de optimización bayesiano prototíptico ( mediante modelos de procesos gaussianos) no se escala bien a muchos hiperparámetros o a muchas evaluaciones de funciones. Atacar esta falta de escalabilidad y flexibilidad es, por tanto, uno de los principales desafíos del campo. Presentamos un enfoque general para usar modelos paramétricos flexibles (redes neuronales) para la optimización bayesiana, que permanece lo más cerca posible de un tratamiento bayesiano verdaderamente. Obtenemos escalabilidad a través del gradiente estocástico Hamiltoniano Monte Carlo, cuya solidez mejoramos a través de una adaptación de escala. Los experimentos que incluyen la optimización bayesiana de varias tareas con 21 tareas, la optimización paralela de redes neuronales profundas y el aprendizaje de refuerzo profundo muestran la eficacia y flexibilidad de este enfoque.