Walk-forward: prueba tu estrategia fuera del entrenamiento
Separa selección y prueba, configura ventanas en Deepwick y aprende a interpretar los límites de los resultados fuera de muestra.
Después de comparar parámetros, el mejor resultado pertenece a una configuración elegida precisamente porque destacó en esos datos. Para comprobar si la regla conserva utilidad en otro tramo, hay que separar la selección de la evaluación. Ese es el objetivo de una prueba walk-forward.
Qué cambia respecto a un backtest único
El entrenamiento utiliza un tramo del histórico para seleccionar parámetros. La prueba utiliza un tramo posterior y mantiene esos parámetros fijos. Se repite el procedimiento en varias ventanas cronológicas.
El estudio The Probability of Backtest Overfitting analiza el riesgo de seleccionar estrategias a partir de pruebas históricas repetidas. Walk-forward ayuda a separar etapas, pero no elimina el sesgo si sigues rediseñando la estrategia después de mirar sus resultados de prueba.
Un ejemplo de ventanas, sin prometer resultados
Supón que tienes 1.000 velas y eliges cuatro bloques con un 60 % para entrenamiento. Cada bloque de 250 contiene 150 velas de entrenamiento y 100 de prueba:
| Bloque | Entrenamiento | Prueba con parámetros fijos |
|---|---|---|
| 1 | Velas 1–150 | Velas 151–250 |
| 2 | Velas 251–400 | Velas 401–500 |
| 3 | Velas 501–650 | Velas 651–750 |
| 4 | Velas 751–900 | Velas 901–1000 |
Esto describe la división por bloques de la herramienta actual de Deepwick. No es una ventana de entrenamiento que acumule automáticamente todos los bloques anteriores. Los números explican el reparto, no garantizan suficientes operaciones ni un calentamiento adecuado para cualquier indicador.
Cómo configurarlo en Deepwick
Necesitas una cuenta y un backtest guardado con inputs numéricos. Si todavía estás en la demo, guarda primero tu estrategia mediante el flujo del dashboard. Abre tus backtests, entra en el informe y elige walk-forward. El enlace segments muestra otro análisis; no es la misma prueba de selección y evaluación.
Selecciona un input en Parameter. Por ejemplo, para una longitud de canal, puedes explorar From 10, To 30, Step 5. Son cinco valores: 10, 15, 20, 25 y 30. Es un rango didáctico, no una recomendación de parámetros para operar.
Configura Folds en 4 y Train ratio en 0.6 si tu muestra permite ese reparto, y pulsa Run walk-forward. La interfaz actual permite barrer un parámetro cada vez. Si el selector está vacío, vuelve a un backtest guardado que incluya inputs numéricos. Si aparece fold_too_small, reduce los bloques o utiliza más histórico: cada lado necesita al menos 50 velas para ejecutarse. Ese mínimo técnico no basta para validar una estrategia.
Qué significan los resultados
Mean OOS Sharpe resume los Sharpe de los tramos de prueba; no es necesariamente el Sharpe de una curva única concatenada. Mean OOS Return es un promedio de retornos de prueba, no una rentabilidad compuesta de cartera. Parameter Stability indica con qué frecuencia ventanas consecutivas eligen el mismo valor.
Un Sharpe fuera de muestra negativo puede deberse a una regla débil, al periodo, a costes o a una muestra pequeña. No prueba por sí solo que haya sobreajuste. Un valor positivo tampoco demuestra una ventaja futura. Una selección estable merece revisión, pero puede ser estable y perder dinero.
Esta herramienta utiliza supuestos propios de costes y ejecución. No compares su cifra con la demo como si ambas configuraciones fueran idénticas. Conserva el script, el rango y los ajustes de cada experimento para poder explicar cualquier diferencia.
Cuándo deja de ser una prueba nueva
Si miras los resultados, cambias el rango y repites hasta que mejoren, has utilizado indirectamente esos tramos para seleccionar el sistema. Registra todas las iteraciones y reserva un periodo posterior o una fase de paper trading para otra evaluación.
Antes de comenzar, escribe qué observación te haría descartar la hipótesis. Esa decisión evita que cada resultado desfavorable se convierta en una excusa para buscar una combinación más. Para revisar las métricas de partida, vuelve a cómo interpretar un backtest.