La regresión simbólica es un método de optimización evolutivo no paramétrico para la identificación de modelos matemáticos en forma de expresiones simbólicas, que tiene como objetivo encontrar una función \( f \) que aproxime con la mayor precisión posible un conjunto de puntos de datos \( (x_i, y_i) \).
Formalmente, la búsqueda se define como un problema de optimización:
\[ \min_{f \in \mathcal{F}} \sum_{i=1}^n (y_i - f(x_i))^2 + \lambda \cdot ext{Complejidad}(f) \]
donde \( \mathcal{F} \) es el espacio de todas las expresiones posibles compuestas por operadores predefinidos (p. ej., \( +, -, imes, \div, \sin, \log \)) y variables, y \( \lambda \) es un parámetro de regularización para controlar la complejidad del modelo.
La optimización se realiza generalmente mediante programación genética, que genera poblaciones de fórmulas, las evalúa y las desarrolla mediante selección, cruce y mutación.
La regresión simbólica suele proporcionar modelos interpretables que representan relaciones físicas o de teoría de sistemas, y se utiliza en áreas como la identificación de sistemas, la ciencia y la ingeniería.
Definición:
«La regresión simbólica es un método de aprendizaje evolutivo que, mediante la búsqueda en un espacio de posibles expresiones matemáticas, encuentra una ecuación que describe datos equilibrando la precisión y la complejidad del modelo.»
Fuente:
Koza, J. R. (1992). Genetic Programming: On the Programming of Computers by Means of Natural Selection. MIT Press.