El problema del sobreajuste
Dale a una computadora suficientes parámetros para optimizar y encontrará una combinación que genere rendimientos espectaculares con datos históricos. Eso no te dice casi nada sobre el futuro. La estrategia ha memorizado el pasado, no ha aprendido de él. A esto se le llama sobreajuste, y es la causa más común por la que las estrategias probadas con backtest fallan en la operativa en vivo.
Bailey, Borwein y Lopez de Prado publicaron un artículo en las Notices of the American Mathematical Society titulado "Pseudo-Mathematics and Financial Charlatanism". Su hallazgo clave: un rendimiento simulado alto es fácilmente alcanzable tras probar un número relativamente pequeño de configuraciones alternativas de estrategia. Bajo efectos de memoria, el sobreajuste del backtest lleva a rendimientos esperados negativos fuera de muestra. No cero. Negativos. Es decir, se espera que la estrategia sobreajustada pierda dinero hacia adelante.
El mismo equipo publicó "The Probability of Backtest Overfitting" en el Journal of Computational Finance en 2015, introduciendo un marco formal para calcular la probabilidad de que cualquier backtest esté sobreajustado. Su Sharpe Ratio Desinflado corrige el sesgo de selección bajo pruebas múltiples y rendimientos no normales.
La prueba fuera de muestra no es negociable
El estándar mínimo para cualquier backtest es la validación fuera de muestra. Divide tus datos en al menos dos períodos. Desarrolla tu estrategia en el primer período (dentro de muestra) y después pruébala en el segundo (fuera de muestra) sin modificaciones. Si el rendimiento se degrada significativamente en los datos fuera de muestra, la estrategia está sobreajustada.
El análisis walk-forward lleva esto más lejos. En lugar de una única división, entrenas repetidamente en una ventana móvil de datos y pruebas en el período siguiente. Entrena con los años 1 a 3, prueba con el año 4. Entrena con los años 2 a 4, prueba con el año 5. Y así sucesivamente. Esto simula cómo se usaría realmente la estrategia en la práctica, con los parámetros reoptimizados periódicamente sobre datos recientes.
La razón entre el rendimiento fuera de muestra y el rendimiento dentro de muestra es la métrica más importante. Una estrategia que genera un Sharpe ratio de 2,0 dentro de muestra y 1,4 fuera de muestra tiene una degradación del 30%, lo cual es razonable y sugiere una ventaja genuina. Una estrategia que genera 3,0 dentro de muestra y 0,5 fuera de muestra está casi totalmente sobreajustada y no debería operarse. Los informes indican que más del 90% de las estrategias académicas fallan en operativa en vivo, y los Sharpe ratios de 3,0 o más en el backtest suelen volverse negativos en producción.
Costes de transacción y deslizamiento
Una estrategia que opera 50 veces al día necesita superar un listón mucho más alto que una que opera dos veces al mes. Cada operación incurre en costes: el diferencial de compra-venta, las comisiones de la bolsa y el deslizamiento.
Los datos de Kaiko Research de 2024 muestran que el diferencial medio en Binance BTC-USDT ronda los 0,0014 puntos básicos, mientras que Coinbase BTC-USD promedia alrededor de 0,086 puntos básicos. En altcoins más pequeñas, los diferenciales pueden alcanzar puntos porcentuales enteros. Entre los brokers institucionales, un deslizamiento TWAP negativo de -1 a -2 puntos básicos es típico en cripto.
Las comisiones de las bolsas se acumulan: Binance cobra 0,10% maker/taker en spot; OKX 0,08% maker, 0,10% taker; Coinbase Advanced va de 0,00% a 0,40% maker y 0,05% a 0,60% taker según el tramo de volumen. Un backtest realista debe contabilizar todos estos costes, y muchos backtests amateurs no lo hacen.
Sesgo de supervivencia
Si tu universo solo incluye activos actualmente listados, tu backtest está sesgado. Empresas que quebraron, tokens que fueron a cero e instrumentos que fueron retirados de cotización faltan en los datos. Dado que estos tienden a ser los peores desempeños, su ausencia hace que toda estrategia larga parezca mejor de lo que realmente fue. En cripto, el efecto es severo porque cientos de tokens lanzados en 2017-2018 fueron a cero y ya no aparecen en la mayoría de los feeds de datos.
Un backtest adecuado usa datos puntuales en el tiempo que incluyan todos los valores disponibles en cada momento histórico, incluidos los que posteriormente desaparecieron.
La duración del drawdown importa
El drawdown máximo te dice la peor caída desde un máximo hasta un mínimo. Pero la duración del drawdown es igualmente importante para la operativa práctica. Una estrategia podría tener un drawdown máximo de solo 15%, pero si ese drawdown duró 18 meses, la mayoría de los traders lo abandonarían mucho antes de que se recuperara. Conocer tanto la profundidad como la duración de los drawdowns históricos te ayuda a evaluar si realmente puedes mantener una estrategia durante sus inevitables períodos perdedores.