Un sistema de trading empieza a tomar forma mucho antes de su primera orden. La idea pone en marcha el trabajo; las decisiones le dan estructura: qué datos utilizar, qué tarea asignar al modelo, cómo medir el riesgo y dónde incorporar agentes de IA. Aprender a relacionar estas decisiones es una capacidad que puedes aprovechar en otros proyectos.
La investigación que dio lugar a Quantic Eagle comenzó antes de constituir la sociedad. Unos diez años de pruebas, desarrollo y decisiones han dejado conocimientos prácticos sobre cómo organizar la investigación, comparar alternativas y reutilizar el trabajo realizado. De esas lecciones nace Antes de arriesgar capital.
Si empezáramos de nuevo, querríamos contar con un mapa del trabajo: qué definir primero, qué construir por etapas y cómo encargar tareas útiles y delimitadas a los agentes de IA. Esta edición reúne parte de esa experiencia en casos visuales, procedimientos, fichas y herramientas que puedes adaptar a tu laboratorio. La duración de la investigación es distinta de la antigüedad de la sociedad y de cualquier historial de resultados en operativa real.
Del dato a la decisión: qué debes poder reconstruir
El modelo es una parte del sistema. Este mapa didáctico relaciona cada etapa con un posible fallo, una comprobación y un registro que conviene conservar. No describe la arquitectura propietaria de Quantic Eagle.
1 Datos disponibles entonces
- Riesgo
- Usar revisiones o información que llegó después de la decisión.
- Comprobación
- Compara el momento de la observación con el de disponibilidad.
- Conserva
- Fuentes, versiones y fechas de disponibilidad.
2 Variables y resultados que aprender
- Riesgo
- Calcular una variable con datos futuros o utilizar un resultado todavía desconocido.
- Comprobación
- Define la ventana de cada variable y cuándo termina cada resultado.
- Conserva
- Definiciones de las variables e intervalos de las etiquetas.
3 Particiones temporales
- Riesgo
- Mezclar pasado y futuro o solapar resultados entre entrenamiento y evaluación.
- Comprobación
- Fija los límites y comprueba las exclusiones antes de entrenar.
- Conserva
- Filas de cada partición y motivos de exclusión.
4 Entrenamiento y selección
- Riesgo
- Elegir modelos, umbrales o transformaciones después de ver la prueba final.
- Comprobación
- Compara una referencia sencilla con las alternativas usando solo los datos destinados a esas decisiones.
- Conserva
- Intentos, parámetros, transformaciones y criterios de selección.
5 Cartera y simulación de ejecución
- Riesgo
- Convertir las mismas puntuaciones en órdenes distintas u omitir costes.
- Comprobación
- Sigue la selección, el tamaño de las posiciones, las restricciones y los costes.
- Conserva
- Trazas de decisiones e hipótesis de ejecución.
6 Equity y riesgo observable
- Riesgo
- Confundir saldo con equity o un depósito con rentabilidad.
- Comprobación
- Incluye posiciones abiertas, frecuencia de muestreo y flujos externos.
- Conserva
- Series, método de ajuste y costes incluidos o excluidos.
7 Evaluación reservada y estrés
- Riesgo
- Tratar una prueba ya consultada durante la selección como evidencia independiente.
- Comprobación
- Evalúa el candidato fijado y registra todos los análisis consultados.
- Conserva
- Resultados OOS, pruebas de estrés e historial de selección.
8 Decisión y nuevas observaciones
- Riesgo
- Cambiar el sistema sin separar las versiones anteriores y posteriores.
- Comprobación
- Documenta la versión, sus límites y las condiciones de la siguiente evaluación.
- Conserva
- Decisión fechada y registro prospectivo separado.
Las flechas indican dependencias del trabajo, no una autorización para operar. Ajusta el preprocesamiento y estima los parámetros solo con los datos permitidos. OOF significa que la predicción procede de un modelo no entrenado con esa partición; por sí solo no garantiza validez temporal. Un periodo OOS utilizado repetidamente para elegir deja de ser una prueba final intacta.
¿Desde dónde partes?
Una guía práctica para quienes quieren desarrollar un proyecto cuantitativo y ya conocen los conceptos básicos de backtesting, riesgo y rentabilidad.
Para leer necesitas un navegador y familiaridad con los conceptos básicos. Los ejercicios de Python requieren saber trabajar con archivos CSV y usar un terminal. Si backtest, drawdown o datos de entrenamiento son términos nuevos, conviene empezar por una formación introductoria.
La aportación distintiva es una selección de casos, decisiones y prácticas de investigación interna: experimentos útiles, vías descartadas, correcciones y resultados que cambiaron el proyecto. La guía explica el razonamiento que puedes aplicar y propone formas de practicarlo.
Seis decisiones para empezar
Da forma a la idea. Define el comportamiento que quieres estudiar y elige una referencia sencilla para comparar. Una pregunta bien planteada también mejora el primer encargo a la IA.
Diseña el trabajo con los datos. Elige universo, fuentes y tiempos de disponibilidad según la decisión que tomará el sistema. El conjunto de datos pasa a ser una parte explícita del proyecto.
Asigna una función a cada modelo. Empieza por una comparación que puedas explicar. Añade complejidad cuando sepas qué aportación buscas y cómo medirla en condiciones equivalentes.
Integra el riesgo en la investigación. Decide cómo observar el patrimonio, los costes y las posiciones abiertas. Interpreta el resultado económico junto con el recorrido necesario para alcanzarlo.
Organiza el trabajo de la IA. Define tareas delimitadas, entradas y criterios de entrega. Mide el trabajo terminado y el tiempo de revisión: ambos te ayudan a decidir qué merece la pena automatizar.
Prepara el próximo experimento. Conserva una versión identificable, registra las decisiones y establece qué observar después. Así, cada experimento puede servir de base para el siguiente.
El recorrido completo relaciona estas decisiones con capítulos, fichas y talleres. Aquí entramos en el laboratorio a través de tres casos: la medición del riesgo, la selección de modelos y la calidad de los datos. Puedes probar una parte del método con la comprobación gratuita del CSV, en tu navegador y sin dejar un correo electrónico.
La curva que no lo mostraba todo
Imagina un índice que empieza en 100 y termina en 104. Las operaciones cerradas nunca provocan un retroceso. El informe muestra un drawdown de cero.
Ahora incluye las posiciones abiertas en esas mismas observaciones. El patrimonio alcanza 101, baja hasta 87 y termina en 104. El drawdown observado es del 13,86 %. El punto final no cambia; lo que cambia es lo que puedes ver durante el recorrido.
Dos curvas. El mismo final.
Es un ejemplo sintético, no un resultado de Quantic Eagle. Muestra por qué la definición de una métrica importa tanto como su valor. En un análisis real necesitas conocer frecuencia de observación, costes, aportaciones y retiradas, y cobertura de las posiciones abiertas. Los datos diarios pueden omitir un mínimo intradía.
La primera comprobación consiste en averiguar si el informe mide el riesgo que quieres entender o solo el que sus datos permiten calcular.
El candidato interesante quedó fuera de la primera selección
En una comparación interna de los primeros 192 backtests de una campaña, nueve de los diez candidatos mejor clasificados económicamente estaban fuera del cuartil superior de la puntuación preliminar en la población de referencia. La correlación de rangos entre ambas clasificaciones fue de aproximadamente 0,27.
¿Quién habría quedado fuera?
El dato corresponde a una muestra seleccionada y a una investigación adaptativa. No demuestra una regla universal, la superioridad de una familia de modelos ni rentabilidad futura. Plantea una pregunta práctica: cuánto trabajo útil puede descartar el filtro con el que decides qué merece una evaluación completa.
Una puntuación preliminar puede medir una parte del problema. La cartera incluye además costes, posiciones simultáneas, riesgo y concentración. La diferencia se aprecia cuando comparas ambas clasificaciones en condiciones coherentes.
Antes de elegir el modelo, decide qué debe aprender
¿Quieres que el sistema reconozca una dirección o que tome una decisión con valor económico? La respuesta cambia la forma de interpretar sus métricas.
La función de pérdida, o loss, guía el entrenamiento. El AUC (área bajo la curva ROC) mide hasta qué punto una puntuación sitúa los ejemplos positivos por encima de los negativos; no mide directamente el valor de las decisiones, sus costes ni el capital que necesitan. Una loss que aproxima un objetivo económico puede dar distinta importancia a errores que una métrica direccional trata por igual.
Por eso, un buen AUC no basta para elegir un sistema de trading. Tampoco un AUC bajo demuestra inteligencia económica. El AUC de entrenamiento describe datos utilizados para aprender: un valor extremo exige revisar la separabilidad, el sobreajuste y las posibles filtraciones de información. Usar una loss económica no convierte ese resultado en una prueba de rendimiento futuro.
En nuestra investigación distinguimos el objetivo de entrenamiento, la puntuación que ayuda a seleccionar candidatos y el resultado del backtest de cartera. Incluso una aproximación económica puede ordenar mal los candidatos cuando el sistema completo aplica costes, límites y reglas de ejecución. El análisis de los 192 candidatos descrito aquí compara una puntuación preliminar con una clasificación de backtest. No es un estudio del AUC ni demuestra que la loss haya causado la discrepancia.
Cuatro oportunidades simultáneas tienen resultados brutos de +1, +8, −1 y −8. Sus etiquetas direccionales son 1, 1, 0 y 0. El modelo A les asigna las puntuaciones 0,9; 0,7; 0,8 y 0,6. El modelo B asigna 0,6; 0,9; 0,7 y 0,8. A ordena correctamente tres de las cuatro parejas positivo-negativo: AUC 0,75. B ordena dos: AUC 0,50. Ambos siguen la misma regla: elegir solo la oportunidad con mayor puntuación. A elige +1 y B elige +8; resta 0,10 de coste a cada operación. Los resultados se conocen después de la elección: no son datos de entrada. El ejemplo demuestra que los objetivos pueden divergir, no que B vaya a funcionar mejor con datos futuros ni que proceda de una loss económica.
El entrenamiento con objetivos económicos también existe en la investigación académica. Lim, Zohren y Roberts describen redes entrenadas para optimizar la ratio de Sharpe, con una penalización de la rotación para tener en cuenta los costes de transacción. Nuestra aportación formativa es el proceso de diseño y comprobación, no haber inventado esta categoría. Estudio original: Enhancing Time Series Momentum Strategies Using Deep Neural Networks.
La pregunta útil es: ¿qué comportamiento estoy premiando y cuánto se parece al que deberá ejecutar el sistema?
Separar las fechas no basta: comprueba cuándo se conocen los resultados
Ejemplo sintético: quieres evaluar decisiones de los periodos 5–6. Una fila de entrenamiento empieza en el periodo 4, pero su etiqueta utiliza un resultado que solo se conoce en el 6. Entrenar antes del periodo 5 con esa etiqueta introduciría información futura.
División aleatoria ingenua
- 1T
- 2V
- 3T
- 4T
- 5V
- 6T
- 7—
- 8—
Usa observaciones posteriores para evaluar decisiones anteriores. No reproduce la tarea de predecir el futuro a partir del pasado.
Walk-forward sin comprobar las etiquetas
- 1T
- 2T
- 3T
- 4T
- 5V
- 6V
- 7—
- 8—
El entrenamiento empieza antes de la evaluación, pero el resultado de la fila 4 llega en el periodo 6. Ordenar las filas por su fecha inicial no lo resuelve.
Walk-forward excluyendo el solapamiento
- 1T
- 2T
- 3T
- 4×
- 5V
- 6V
- 7—
- 8—
Se excluye la fila 4. En este ejemplo, los resultados de las filas 1–3 ya se conocen antes del periodo 5; con datos reales hay que comprobar cada intervalo.
Purgado, embargo y separación antes de la prueba
El purgado excluye del entrenamiento las observaciones cuyos intervalos de etiqueta se solapan con la evaluación. El embargo puede excluir un tramo posterior a la prueba cuando el diseño de validación cruzada admite datos de entrenamiento posteriores. Busca limitar dependencias residuales, por ejemplo las debidas a ventanas de información solapadas. Un walk-forward estrictamente causal no entrena con esas observaciones futuras; un intervalo de exclusión anterior a la prueba es un gap. Su duración y sus límites dependen de las etiquetas, la disponibilidad de los datos y las ventanas de las variables. No existe un número universal de días.
Estas exclusiones no corrigen datos publicados con retraso, normalizaciones ajustadas con todo el conjunto ni selecciones repetidas sobre la prueba. Conserva las filas excluidas y los motivos, incluye un ejemplo defectuoso que la comprobación deba detectar y registra qué resultados habías visto antes de decidir.
Pruébalo sobre el papel: una fila empieza en el periodo 4 y su resultado termina en el 6. ¿Puedes usarla para entrenar un modelo que decide al comienzo del 5? No. Cambia ahora el final del resultado al periodo 4: ese solapamiento desaparece, pero aún hay que comprobar la disponibilidad de las variables y el historial de selección.
Para la separación cronológica y el parámetro gap, consulta la documentación oficial de TimeSeriesSplit. Para el riesgo de seleccionar entre muchos backtests, consulta a Bailey y sus coautores. Ninguna de estas referencias certifica este proyecto ni garantiza resultados futuros.
scikit-learn: TimeSeriesSplit · Bailey et al.: The Probability of Backtest Overfitting
Un archivo idéntico puede seguir incompleto
Una comprobación de integridad puede confirmar que tienes el archivo previsto. También puede confirmar, con total exactitud, que has reproducido el mismo hueco informativo.
Nuestras auditorías exigieron separar tres comprobaciones: identidad del archivo, cobertura de los datos e historial realmente disponible para calcular los indicadores. Cada una responde a una pregunta diferente.
Tres situaciones que conviene distinguir
— Tramo inicial previsto · ✓ Disponible · ! Hueco inesperado
Las primeras observaciones de un indicador pueden faltar por una razón prevista. Un hueco inesperado meses después exige investigar. Eliminar todas las filas incompletas puede ocultar la diferencia y modificar la muestra.
Convertir la experiencia en algo que puedas usar
Un asistente de IA puede explicar estos conceptos. Para reconstruir fielmente las decisiones, las pruebas y las comprobaciones de nuestro archivo privado necesita acceder a esos materiales. El trabajo de esta edición consiste en seleccionar y explicar parte de esa experiencia, y convertirla en procedimientos utilizables sin distribuir las configuraciones propietarias.
Cada caso sigue una secuencia: qué queríamos averiguar, qué parecía cierto, qué comprobación cambió la lectura y qué puede aplicar el lector. También se explican las decisiones de detener una línea de investigación.
Volver a empezar aborda el siguiente paso: cómo organizar hoy un laboratorio didáctico pequeño, con una idea, una referencia sencilla, datos utilizables, tareas acotadas para los agentes y resultados verificables. El objetivo es evitar pruebas innecesarias. El tiempo que puedas ahorrar dependerá de tu punto de partida y de cómo uses el material.
Seis respuestas antes del próximo experimento
Tres episodios explican por qué hemos decidido abrir una parte del laboratorio.
Las probabilidades coincidían. Las órdenes podían cambiar.
Una auditoría había verificado los modelos, datos y predicciones de una simulación. Una comprobación posterior encontró una diferencia en el componente que resolvía conflictos entre direcciones. La simulación recorría efectivamente esa rama. Se retiró la calificación de réplica exacta y se conservó el resultado como evidencia diagnóstica.
Dónde divergen los recorridos
La conclusión práctica sorprende: modelos idénticos pueden producir carteras distintas. Entre predicción y orden están prioridades, capacidad y gestión. Una plaza ocupada ahora cambia qué oportunidades pueden admitirse después. Verificar la réplica exige seguir la decisión a lo largo de toda la cadena.
El manual explica cómo localizar la primera divergencia y decidir qué cálculos pueden reutilizarse. Repetirlo todo no siempre es necesario; conservarlo todo sin distinguir dependencias puede resultar igualmente equivocado.
El agente analizaba varias veces los mismos objetos
Un componente de IA recibía la lista global de candidatos en cada lote pequeño. Las respuestas se concatenaban sin controles completos de ámbito y unicidad. La duplicación empezaba en el contrato de datos, antes de evaluar la calidad del razonamiento.
Con doce objetos en cuatro lotes, la prueba es sencilla: cada objeto debe pertenecer a su lote, una sola vez. No hace falta pagar por usar un modelo para comprobarlo. Hacen falta identificadores, respuestas simuladas y un procesador que rechace lo que quede fuera del ámbito.
La pregunta económica viene después: ¿se guardó información suficiente para saber si el componente ayudaba? En el caso interno, no. El gasto era real y las pruebas conservadas no permitían demostrar el beneficio; se suspendió el componente. Esa decisión forma parte de la experiencia que merece compartirse tanto como una solución que ha funcionado.
El informe frenaba lo que contaba
Una cola de investigación tenía cachés y procesos paralelos. Sin embargo, generar el informe dentro del ciclo de admisión retrasaba la entrada de nuevos trabajos. El sistema parecía preparado para trabajar en paralelo mientras una función auxiliar introducía esperas.
Para quien dirige un laboratorio pequeño con IA, automatizar también significa separar responsabilidades, definir quién escribe y verificar una recuperación sin duplicar trabajo. Un panel elegante no demuestra avance. Lo demuestran resultados completos, comprobados y recuperables.
La comprobación que puedes llevarte
- ¿Qué información estaba disponible al tomar la decisión?
- ¿Qué resultados habías consultado antes de seleccionar el modelo?
- ¿La curva trata de forma coherente posiciones abiertas, costes y movimientos de capital?
- ¿La comparación cambia una sola cosa o varias condiciones a la vez?
- ¿Otra persona puede reproducir el resultado con el material conservado?
- ¿Qué resultado te haría descartar la hipótesis?
Las respuestas pendientes indican dónde trabajar. No califican tu capacidad ni certifican una estrategia.
De la lectura a tu propio laboratorio
Antes de arriesgar capital — Protocolo de verificación de la investigación conecta veinte capítulos y los casos del laboratorio con siete comandos Python para revisar el drawdown observado, las contradicciones temporales, las particiones temporales con purgado, las clasificaciones, las trazas de decisión, los lotes y las ventanas de observación. Cada comando utiliza archivos CSV o JSON según su formato documentado. Incluye un notebook reproducible, pruebas, doce fichas y encargos para agentes. La entrega prevista es un paquete en el idioma que elijas: español, inglés o italiano.
Cada recorrido parte de un problema, ofrece un comando y muestra el resultado esperado. Primero reproduces el ejemplo; después conectas una copia de tus datos. El informe conserva los hashes de los archivos de entrada, la versión y los parámetros. El encargo al agente también exige un contraejemplo: una explicación convincente se convierte en una afirmación que puedes poner a prueba.
No necesitas compartir tu estrategia con nosotros. Explora el contenido de la guía y empieza por el caso que reconozcas en tu trabajo.
El objetivo es terminar con un dosier que puedas entender, reproducir y cuestionar. El material no incluye señales de trading, modelos propietarios ni garantías de ingresos.
La guía está en preparación. Los recursos de este sitio son gratuitos. Puedes pedir un único correo cuando esté lista; no se admiten compras ni reservas. Avísame cuando esté lista.
Fuentes y alcance
El caso de los 192 backtests procede de investigación interna de Quantic Eagle del 16 de septiembre de 2026, sin auditoría independiente. Las demás figuras son conceptuales o sintéticas. Los diez años describen el recorrido de investigación declarado por el fundador, anterior a la sociedad, no diez años de resultados en operativa real.
Sobre la selección entre múltiples backtests: Bailey et al., The Probability of Backtest Overfitting. Quantic Eagle opera con capital propio y no capta ni gestiona fondos de terceros. Este contenido ofrece formación metodológica general, no recomendaciones de inversión.
El museo de los falsos verdes
Dos programas devuelven probabilidades idénticas. Uno elige A; el otro, B. Dos lotes devuelven JSON válido, pero repiten los mismos objetos. Una variable es un número finito, aunque su ventana tiene un hueco. Tres resultados tranquilizadores; tres preguntas sin responder.
En el Museo de los falsos verdes puedes mostrar cada fallo y aplicar su corrección. Las figuras sintéticas se pueden descargar para explicar a un compañero por qué superar una comprobación no equivale a demostrar una conclusión. No hace falta registrarse.
A menudo, lo más útil de la experiencia es saber dónde termina una prueba. Las puntuaciones pueden coincidir exactamente sin que se haya revisado la selección. Un hash correcto puede identificar datos incompletos. Un agente puede cumplir el encargo sin que se haya medido su aportación económica.
El protocolo completo añade seis talleres, tres comprobaciones del flujo de trabajo y un dosier que reúne hallazgos, referencias de los archivos utilizados y controles pendientes. Cada contraejemplo tiene una versión corregida: primero exigimos que la herramienta las distinga y después la aplicamos a nuestros datos.
Si tus observaciones de equity usan otros nombres de columna, el conversor local de columnas ayuda a prepararlas. Si solo tienes operaciones cerradas, no inventa la curva que falta. Ese límite forma parte del producto: identificar qué falta por comprobar antes de sacar conclusiones.