Módulo 12 · Lección 02 · Intermedio · 16 min

Sample size y sesgos: cherry picking, look-ahead bias y overfitting

Casi nadie falsea un backtest a propósito. Lo que ocurre es que la muestra es pequeña, la memoria selecciona, el ojo ve el futuro sin querer y las reglas se van amoldando al pasado. Esta lección es un catálogo de esas trampas y de cómo cerrarles la puerta.

Qué vas a aprender
  • Por qué una muestra corta produce resultados que parecen sólidos y no lo son
  • Qué es el cherry picking y cómo aparece incluso cuando crees estar siendo objetivo
  • Qué es el look-ahead bias: usar información que aún no existía en la vela
  • Qué es el sesgo de supervivencia y por qué solo ves los sistemas que sobrevivieron
  • Qué es el overfitting y cómo distinguir una regla de mercado de una regla que describe la historia

Sample size: por qué veinte operaciones no dicen casi nada

Definición

El sample size o tamaño de muestra es el número de operaciones sobre las que has calculado tus métricas. Cuanto más pequeño, más peso tiene el azar en el resultado y más ancho es el margen de error de cualquier conclusión.

No hace falta estadística formal para entender el problema. Imagina una moneda equilibrada. Si la lanzas veinte veces, obtener catorce caras (un 70%) no es raro; ocurre con una frecuencia que sorprende a casi todo el mundo. Si la lanzas mil veces, obtener setecientas caras es prácticamente imposible. La moneda es la misma; lo que cambia es cuánto puede desviarse el resultado observado del comportamiento real.

Con un sistema de trading pasa lo mismo, pero peor, porque tu 'moneda' no es equilibrada ni estable, y porque los resultados no son solo ganar o perder sino cantidades distintas de R. Con veinte operaciones, un win rate observado del 60% es compatible con un sistema real que acierta el 40% y con uno que acierta el 80%. El intervalo es tan ancho que no dice casi nada. Con cien operaciones el intervalo se estrecha bastante; con varios cientos, empieza a ser útil. No hay un número mágico a partir del cual 'ya vale': lo que hay es una incertidumbre que se reduce despacio y nunca llega a cero.

Ojo

La intuición humana está mal calibrada para esto. Una racha de ocho aciertos seguidos se siente como prueba de algo. Estadísticamente, en un sistema que acierta la mitad de las veces, aparecerán rachas de ocho con cierta regularidad si operas lo suficiente. La sensación de certeza llega mucho antes que la evidencia.

Hay una segunda dimensión del sample size que se olvida: no solo cuántas operaciones, sino cuánto mercado distinto cubren. Doscientas operaciones concentradas en dos meses de tendencia alcista limpia son una muestra grande de una sola condición. Lo desarrollarás en la lección de regímenes.

esquema ilustrativo · gráfico real pendiente
Esquema: intervalo de win rate compatible con los datos observados para 20, 100 y 500 operaciones. La barra se estrecha con la muestra pero nunca se convierte en un punto. Placeholder.

Cherry picking

Definición

Cherry picking es seleccionar, consciente o inconscientemente, los ejemplos que confirman lo que quieres ver y omitir los que lo contradicen.

En backtesting aparece de varias formas, y la mayoría no se perciben como trampa:

  • Elegir el tramo de precio. 'Voy a probar el setup en estas tres semanas' — y esas tres semanas son las que recuerdas porque el setup funcionó. El tramo debe elegirse antes de saber cómo salió, por criterio externo (por ejemplo, 'los últimos seis meses completos'), no por memoria.
  • Contar solo las ocurrencias que se ven. El ojo encuentra sin esfuerzo las veces en que el patrón se formó y funcionó, porque el movimiento posterior las hace visibles. Las veces en que se formó y falló quedan enterradas entre velas sin interés. Un backtest honesto recorre el gráfico vela a vela y cuenta todas.
  • Resolver las ambiguas a favor. Ya lo viste en la lección anterior: la operación dudosa que habría ganado 'cuenta', la que habría perdido 'no cumplía'. Sin reglas cerradas, esto es inevitable.
  • Descartar 'excepciones'. 'Esa no cuenta porque había noticia', 'esa no cuenta porque era viernes'. Si el filtro de noticias o de viernes no estaba escrito en el plan antes de empezar, la operación cuenta. Si crees que el filtro es necesario, lo añades al plan y reinicias.
Regla personal

El antídoto es procedimental, no de fuerza de voluntad: tramo elegido por criterio externo, recorrido vela a vela sin saltar, y hoja de registro donde cada ocurrencia se anota antes de ver el resultado.

Look-ahead bias: ver el futuro sin querer

Definición

Look-ahead bias es tomar una decisión en el backtest usando información que, en el momento real de esa decisión, todavía no existía.

Es el sesgo más traicionero porque casi nunca es deliberado. En un gráfico estático ves a la vez la vela donde 'entrarías' y las diez siguientes. Aunque intentes no mirarlas, ya las has visto. Tu criterio sobre si la vela de confirmación 'es suficientemente fuerte' está contaminado por saber que después el precio se fue a favor.

Ejemplos concretos en un backtest de MNQ:

  • Decidir que hubo displacement porque la vela cerró con cuerpo grande, cuando en tiempo real la entrada habría sido antes del cierre, con la vela aún formándose.
  • Marcar una zona como Order Block válido porque ves que el precio, más adelante, la respetó. En vivo la habrías marcado (o no) sin saberlo.
  • Usar el máximo o mínimo del día para definir el contexto cuando ese máximo se hizo después de tu entrada.
  • Colocar el stop 'justo por debajo del mínimo que aguantó', un mínimo que sabes que aguantó porque estás viendo el gráfico completo.

La solución técnica es el replay vela a vela con el futuro oculto, que verás en la lección 4: la plataforma te muestra el precio hasta un instante y nada más, y tú decides con lo que hay. Sin esa herramienta, el backtest manual sobre gráfico estático tiene un techo de fiabilidad bajo, por mucho cuidado que pongas.

Ojo

Un caso frecuente y sutil: usar la vela cerrada de 5 minutos como confirmación cuando tu ejecución real sería en 1 minuto y entrarías antes de que la de 5 cerrara. La información 'vela de 5 cerrada' no existía en el momento de tu entrada. O ajustas la regla al momento real de decisión, o el backtest te dará entradas mejores de las que puedes obtener.

Sesgo de supervivencia

Definición

El sesgo de supervivencia consiste en sacar conclusiones observando solo lo que ha sobrevivido a un proceso de selección, ignorando todo lo que quedó por el camino.

En trading tiene dos caras. La primera es externa: los sistemas, traders y cuentas que ves publicadas son los que han funcionado hasta hoy. No ves los cientos de variantes del mismo setup que fracasaron, porque nadie publica una cuenta en pérdidas ni un método abandonado. Eso hace que cualquier método 'que funciona' parezca más común y más fiable de lo que es.

La segunda cara es interna, y es la que te afecta en el backtest: si has probado ocho variantes de un setup y te has quedado con la que mejor salió, el resultado de esa variante está inflado por el propio proceso de selección. Entre ocho versiones de casi cualquier cosa, una saldrá bien por azar. Has seleccionado la superviviente y ahora la tratas como si fuera la única que existió.

Regla personal

Anota cuántas variantes has probado antes de quedarte con una. Si son muchas, la ganadora necesita una validación aparte —sobre un tramo de datos que no usaste para elegirla— antes de creer su resultado.

Overfitting: reglas que se ajustan al pasado

Definición

Overfitting o sobreajuste es afinar las reglas de un sistema hasta que describen con precisión lo que ocurrió en la muestra, perdiendo la capacidad de describir lo que ocurrirá fuera de ella.

El mecanismo es casi siempre el mismo. Haces el backtest, ves que el sistema perdió cinco veces entre las 15:30 y las 15:45, y añades la regla 'no operar entre las 15:30 y las 15:45'. El resultado mejora. Ves que las pérdidas se concentraron en días con FVG de 15 minutos sin rellenar por encima, y añades otro filtro. Mejora. Tras diez filtros de este tipo, tu sistema tiene una curva de resultados preciosa sobre la muestra y un conjunto de reglas que nadie podría justificar por lógica de mercado. Has memorizado la historia.

Cómo distinguir una regla legítima de una sobreajustada:

  • Una regla legítima tiene una razón de mercado que podías haber formulado antes de ver los datos. 'No operar en los primeros minutos de la apertura porque el spread y la volatilidad deforman el stop' es una razón. 'No operar entre las 15:30 y las 15:45' porque ahí hubo cinco pérdidas no lo es.
  • Una regla legítima es tosca; una sobreajustada es precisa. Cuanto más específico el número —'stop de 17,5 puntos', 'solo si el retroceso llega al 0,705 exacto'—, más probable que esté describiendo ruido.
  • Una regla legítima elimina muchas operaciones malas y también algunas buenas. Si un filtro solo quita pérdidas y ninguna ganancia, sospecha: lo has construido mirando cuáles eran las pérdidas.
  • Pocas reglas. Cada regla añadida es un grado de libertad más para adaptarse a la muestra. Un sistema con cuatro reglas que gana moderadamente es más fiable que uno con quince que gana mucho en el mismo tramo.
Regla personal

Separa los datos. Diseña y ajusta el sistema sobre un tramo (por ejemplo, los primeros cuatro meses del periodo). Cuando creas que está cerrado, aplícalo sin tocar nada sobre el tramo que no has mirado (los dos meses siguientes). Si el resultado se derrumba fuera de la muestra de diseño, el sistema estaba sobreajustado. Esta idea —datos de diseño frente a datos de validación— es la misma que justifica el forward test: el futuro es el único tramo de datos que no puedes haber mirado.

curva de resultados en R · ilustrativa
Dos curvas en R: una casi perfecta en el tramo de diseño que se rompe en el tramo de validación (sobreajustada), y otra más irregular que mantiene la pendiente en ambos. Placeholder.

Ejemplo

Un alumno prueba un setup de continuación en MNQ sobre cuatro meses y obtiene 42 operaciones con expectativa positiva. Está contento hasta que revisa su procedimiento con esta lección al lado.

Sample size: 42 operaciones. El intervalo de su win rate observado es tan ancho que no distingue un sistema bueno de uno mediocre. Anota: necesita al menos duplicar la muestra, y en meses distintos.

Look-ahead: hizo el backtest sobre gráfico estático. En al menos diez operaciones, reconoce que decidió la validez del displacement viendo la vela cerrada, cuando su entrada real habría sido intravela. Anota: repetir en replay.

Overfitting: durante el proceso añadió dos filtros ('no operar tras un día de rango' y 'solo si el barrido supera 8 puntos'). El primero tiene lógica de mercado que podría haber formulado antes. El segundo lo sacó mirando qué barridos habían fallado. Anota: quitar el segundo, o justificarlo con lógica de mercado y volver a probarlo sobre un tramo nuevo.

El sistema puede seguir siendo bueno. Pero ahora sabe qué parte de sus 42 operaciones es evidencia y qué parte es ruido.

Error frecuente

Optimizar el resultado del backtest en vez de la honestidad del backtest. El alumno mide el éxito del ejercicio por la curva final: cuanto mejor sale, mejor cree que ha trabajado. Así, cada decisión de procedimiento se toma en la dirección que mejora la curva —añadir un filtro, descartar un tramo, contar la operación dudosa— y el resultado converge inevitablemente hacia algo excelente y falso.

El objetivo de un backtest no es que salga bien. Es que salga verdadero. Un backtest honesto con resultado mediocre vale infinitamente más que uno espectacular que no describe nada.

Ejercicio

Antes de tu primer backtest, escribe en la parte superior de la hoja de registro cuatro compromisos: (1) el tramo exacto de fechas que vas a recorrer, elegido ahora y sin mirar el gráfico; (2) que anotarás toda ocurrencia del setup antes de avanzar el replay; (3) la lista completa de reglas, numeradas, y la promesa de reiniciar si añades una; (4) qué tramo de fechas reservas para validación y no tocarás hasta terminar.

Después haz una lista de las reglas actuales de tu plan y, junto a cada una, escribe la razón de mercado que la justifica en una frase. Si alguna no la tiene, es candidata a sobreajuste. Decide si la quitas o la mantienes como hipótesis explícita a validar.

Qué debes recordar

  1. Con pocas operaciones el resultado está dominado por el azar; el intervalo de lo que 'podría ser' tu sistema es enorme y se estrecha despacio.
  2. Cherry picking: elegir tramo, contar solo lo visible, resolver las dudosas a favor. Se evita con tramo fijado antes, recorrido vela a vela y registro previo al resultado.
  3. Look-ahead bias: decidir con información que no existía en ese instante. Se evita con replay y futuro oculto, y ajustando la regla al momento real de decisión.
  4. Sesgo de supervivencia: solo ves lo que sobrevivió, fuera y dentro de tu propio proceso de selección de variantes.
  5. Overfitting: reglas afinadas sobre la historia. Pocas reglas, con razón de mercado, toscas, y un tramo de datos reservado para validar.

Términos de esta lección

Definiciones completas en el glosario del curso.

Contenido educativo. No es recomendación de inversión ni asesoramiento financiero. Los futuros son productos apalancados: puedes perder más de lo invertido. Ningún concepto de este curso garantiza resultados.