Formación sobre investigación · Quantic Eagle opera solo con capital propio. Sin fondos de clientes, asesoramiento financiero ni señales de trading.

Cómo diseñar un sistema de trading con IA: lecciones de diez años de investigación

El oficio detrás de los modelos. Las decisiones que convierten una idea en un proyecto.

Edición de investigación · Actualizada el 18 de septiembre de 2026

Un sistema de trading empieza a tomar forma mucho antes de su primera orden. La idea pone en marcha el trabajo; las decisiones le dan estructura: qué datos utilizar, qué tarea asignar al modelo, cómo medir el riesgo y dónde incorporar agentes de IA. Aprender a relacionar estas decisiones es una capacidad que puedes aprovechar en otros proyectos.

La investigación que dio lugar a Quantic Eagle comenzó antes de constituir la sociedad. Unos diez años de pruebas, desarrollo y decisiones han dejado conocimientos prácticos sobre cómo organizar la investigación, comparar alternativas y reutilizar el trabajo realizado. De esas lecciones nace Antes de arriesgar capital.

Si empezáramos de nuevo, querríamos contar con un mapa del trabajo: qué definir primero, qué construir por etapas y cómo encargar tareas útiles y delimitadas a los agentes de IA. Esta edición reúne parte de esa experiencia en casos visuales, procedimientos, fichas y herramientas que puedes adaptar a tu laboratorio. La duración de la investigación es distinta de la antigüedad de la sociedad y de cualquier historial de resultados en operativa real.

Del dato a la decisión: qué debes poder reconstruir

El modelo es una parte del sistema. Este mapa didáctico relaciona cada etapa con un posible fallo, una comprobación y un registro que conviene conservar. No describe la arquitectura propietaria de Quantic Eagle.

  1. 1 Datos disponibles entonces

    Riesgo
    Usar revisiones o información que llegó después de la decisión.
    Comprobación
    Compara el momento de la observación con el de disponibilidad.
    Conserva
    Fuentes, versiones y fechas de disponibilidad.
  2. 2 Variables y resultados que aprender

    Riesgo
    Calcular una variable con datos futuros o utilizar un resultado todavía desconocido.
    Comprobación
    Define la ventana de cada variable y cuándo termina cada resultado.
    Conserva
    Definiciones de las variables e intervalos de las etiquetas.
  3. 3 Particiones temporales

    Riesgo
    Mezclar pasado y futuro o solapar resultados entre entrenamiento y evaluación.
    Comprobación
    Fija los límites y comprueba las exclusiones antes de entrenar.
    Conserva
    Filas de cada partición y motivos de exclusión.
  4. 4 Entrenamiento y selección

    Riesgo
    Elegir modelos, umbrales o transformaciones después de ver la prueba final.
    Comprobación
    Compara una referencia sencilla con las alternativas usando solo los datos destinados a esas decisiones.
    Conserva
    Intentos, parámetros, transformaciones y criterios de selección.
  5. 5 Cartera y simulación de ejecución

    Riesgo
    Convertir las mismas puntuaciones en órdenes distintas u omitir costes.
    Comprobación
    Sigue la selección, el tamaño de las posiciones, las restricciones y los costes.
    Conserva
    Trazas de decisiones e hipótesis de ejecución.
  6. 6 Equity y riesgo observable

    Riesgo
    Confundir saldo con equity o un depósito con rentabilidad.
    Comprobación
    Incluye posiciones abiertas, frecuencia de muestreo y flujos externos.
    Conserva
    Series, método de ajuste y costes incluidos o excluidos.
  7. 7 Evaluación reservada y estrés

    Riesgo
    Tratar una prueba ya consultada durante la selección como evidencia independiente.
    Comprobación
    Evalúa el candidato fijado y registra todos los análisis consultados.
    Conserva
    Resultados OOS, pruebas de estrés e historial de selección.
  8. 8 Decisión y nuevas observaciones

    Riesgo
    Cambiar el sistema sin separar las versiones anteriores y posteriores.
    Comprobación
    Documenta la versión, sus límites y las condiciones de la siguiente evaluación.
    Conserva
    Decisión fechada y registro prospectivo separado.

Las flechas indican dependencias del trabajo, no una autorización para operar. Ajusta el preprocesamiento y estima los parámetros solo con los datos permitidos. OOF significa que la predicción procede de un modelo no entrenado con esa partición; por sí solo no garantiza validez temporal. Un periodo OOS utilizado repetidamente para elegir deja de ser una prueba final intacta.

¿Desde dónde partes?

Una guía práctica para quienes quieren desarrollar un proyecto cuantitativo y ya conocen los conceptos básicos de backtesting, riesgo y rentabilidad.

Para leer necesitas un navegador y familiaridad con los conceptos básicos. Los ejercicios de Python requieren saber trabajar con archivos CSV y usar un terminal. Si backtest, drawdown o datos de entrenamiento son términos nuevos, conviene empezar por una formación introductoria.

La aportación distintiva es una selección de casos, decisiones y prácticas de investigación interna: experimentos útiles, vías descartadas, correcciones y resultados que cambiaron el proyecto. La guía explica el razonamiento que puedes aplicar y propone formas de practicarlo.

Seis decisiones para empezar

Da forma a la idea. Define el comportamiento que quieres estudiar y elige una referencia sencilla para comparar. Una pregunta bien planteada también mejora el primer encargo a la IA.

Diseña el trabajo con los datos. Elige universo, fuentes y tiempos de disponibilidad según la decisión que tomará el sistema. El conjunto de datos pasa a ser una parte explícita del proyecto.

Asigna una función a cada modelo. Empieza por una comparación que puedas explicar. Añade complejidad cuando sepas qué aportación buscas y cómo medirla en condiciones equivalentes.

Integra el riesgo en la investigación. Decide cómo observar el patrimonio, los costes y las posiciones abiertas. Interpreta el resultado económico junto con el recorrido necesario para alcanzarlo.

Organiza el trabajo de la IA. Define tareas delimitadas, entradas y criterios de entrega. Mide el trabajo terminado y el tiempo de revisión: ambos te ayudan a decidir qué merece la pena automatizar.

Prepara el próximo experimento. Conserva una versión identificable, registra las decisiones y establece qué observar después. Así, cada experimento puede servir de base para el siguiente.

El recorrido completo relaciona estas decisiones con capítulos, fichas y talleres. Aquí entramos en el laboratorio a través de tres casos: la medición del riesgo, la selección de modelos y la calidad de los datos. Puedes probar una parte del método con la comprobación gratuita del CSV, en tu navegador y sin dejar un correo electrónico.

La curva que no lo mostraba todo

Imagina un índice que empieza en 100 y termina en 104. Las operaciones cerradas nunca provocan un retroceso. El informe muestra un drawdown de cero.

Ahora incluye las posiciones abiertas en esas mismas observaciones. El patrimonio alcanza 101, baja hasta 87 y termina en 104. El drawdown observado es del 13,86 %. El punto final no cambia; lo que cambia es lo que puedes ver durante el recorrido.

Ejemplo sintético · No representa resultados de Quantic Eagle

Dos curvas. El mismo final.

Operaciones cerradasPatrimonio con posiciones abiertas
Índice, base 100
901001051612
Observación
Ambas terminan en 104. DD de operaciones cerradas: 0 %. DD observado del patrimonio: 13,86 %.

Es un ejemplo sintético, no un resultado de Quantic Eagle. Muestra por qué la definición de una métrica importa tanto como su valor. En un análisis real necesitas conocer frecuencia de observación, costes, aportaciones y retiradas, y cobertura de las posiciones abiertas. Los datos diarios pueden omitir un mínimo intradía.

La primera comprobación consiste en averiguar si el informe mide el riesgo que quieres entender o solo el que sus datos permiten calcular.

El candidato interesante quedó fuera de la primera selección

En una comparación interna de los primeros 192 backtests de una campaña, nueve de los diez candidatos mejor clasificados económicamente estaban fuera del cuartil superior de la puntuación preliminar en la población de referencia. La correlación de rangos entre ambas clasificaciones fue de aproximadamente 0,27.

Investigación interna adaptativa · 192 candidatos · 16 de septiembre de 2026

¿Quién habría quedado fuera?

1 en el cuartil superior9 fuera
9 de los 10 mejores candidatos del backtest quedaron fuera del cuartil superior de la puntuación preliminar en la población de referencia. Los símbolos representan cantidades, no posiciones.

El dato corresponde a una muestra seleccionada y a una investigación adaptativa. No demuestra una regla universal, la superioridad de una familia de modelos ni rentabilidad futura. Plantea una pregunta práctica: cuánto trabajo útil puede descartar el filtro con el que decides qué merece una evaluación completa.

Una puntuación preliminar puede medir una parte del problema. La cartera incluye además costes, posiciones simultáneas, riesgo y concentración. La diferencia se aprecia cuando comparas ambas clasificaciones en condiciones coherentes.

Antes de elegir el modelo, decide qué debe aprender

¿Quieres que el sistema reconozca una dirección o que tome una decisión con valor económico? La respuesta cambia la forma de interpretar sus métricas.

La función de pérdida, o loss, guía el entrenamiento. El AUC (área bajo la curva ROC) mide hasta qué punto una puntuación sitúa los ejemplos positivos por encima de los negativos; no mide directamente el valor de las decisiones, sus costes ni el capital que necesitan. Una loss que aproxima un objetivo económico puede dar distinta importancia a errores que una métrica direccional trata por igual.

Por eso, un buen AUC no basta para elegir un sistema de trading. Tampoco un AUC bajo demuestra inteligencia económica. El AUC de entrenamiento describe datos utilizados para aprender: un valor extremo exige revisar la separabilidad, el sobreajuste y las posibles filtraciones de información. Usar una loss económica no convierte ese resultado en una prueba de rendimiento futuro.

En nuestra investigación distinguimos el objetivo de entrenamiento, la puntuación que ayuda a seleccionar candidatos y el resultado del backtest de cartera. Incluso una aproximación económica puede ordenar mal los candidatos cuando el sistema completo aplica costes, límites y reglas de ejecución. El análisis de los 192 candidatos descrito aquí compara una puntuación preliminar con una clasificación de backtest. No es un estudio del AUC ni demuestra que la loss haya causado la discrepancia.

AUCResultado netoAB0,750,50+0,90+7,900 → 10 → 8
Ejemplo sintético: cuatro oportunidades, una elección por modelo, igual tamaño y un coste de 0,10 unidades. AUC: A 0,75, B 0,50. Resultado neto: A +0,90, B +7,90. Las columnas usan escalas distintas. No se ha entrenado ningún modelo para este ejemplo.

Cuatro oportunidades simultáneas tienen resultados brutos de +1, +8, −1 y −8. Sus etiquetas direccionales son 1, 1, 0 y 0. El modelo A les asigna las puntuaciones 0,9; 0,7; 0,8 y 0,6. El modelo B asigna 0,6; 0,9; 0,7 y 0,8. A ordena correctamente tres de las cuatro parejas positivo-negativo: AUC 0,75. B ordena dos: AUC 0,50. Ambos siguen la misma regla: elegir solo la oportunidad con mayor puntuación. A elige +1 y B elige +8; resta 0,10 de coste a cada operación. Los resultados se conocen después de la elección: no son datos de entrada. El ejemplo demuestra que los objetivos pueden divergir, no que B vaya a funcionar mejor con datos futuros ni que proceda de una loss económica.

El entrenamiento con objetivos económicos también existe en la investigación académica. Lim, Zohren y Roberts describen redes entrenadas para optimizar la ratio de Sharpe, con una penalización de la rotación para tener en cuenta los costes de transacción. Nuestra aportación formativa es el proceso de diseño y comprobación, no haber inventado esta categoría. Estudio original: Enhancing Time Series Momentum Strategies Using Deep Neural Networks.

La pregunta útil es: ¿qué comportamiento estoy premiando y cuánto se parece al que deberá ejecutar el sistema?

Separar las fechas no basta: comprueba cuándo se conocen los resultados

Ejemplo sintético: quieres evaluar decisiones de los periodos 5–6. Una fila de entrenamiento empieza en el periodo 4, pero su etiqueta utiliza un resultado que solo se conoce en el 6. Entrenar antes del periodo 5 con esa etiqueta introduciría información futura.

T = entrenamiento · V = evaluación · × = fila excluida · — = sin utilizar. Los números representan periodos hipotéticos, no fechas ni rentabilidades reales.

División aleatoria ingenua

  1. 1T
  2. 2V
  3. 3T
  4. 4T
  5. 5V
  6. 6T
  7. 7
  8. 8

Usa observaciones posteriores para evaluar decisiones anteriores. No reproduce la tarea de predecir el futuro a partir del pasado.

Walk-forward sin comprobar las etiquetas

  1. 1T
  2. 2T
  3. 3T
  4. 4T
  5. 5V
  6. 6V
  7. 7
  8. 8

El entrenamiento empieza antes de la evaluación, pero el resultado de la fila 4 llega en el periodo 6. Ordenar las filas por su fecha inicial no lo resuelve.

Walk-forward excluyendo el solapamiento

  1. 1T
  2. 2T
  3. 3T
  4. 4×
  5. 5V
  6. 6V
  7. 7
  8. 8

Se excluye la fila 4. En este ejemplo, los resultados de las filas 1–3 ya se conocen antes del periodo 5; con datos reales hay que comprobar cada intervalo.

Purgado, embargo y separación antes de la prueba

El purgado excluye del entrenamiento las observaciones cuyos intervalos de etiqueta se solapan con la evaluación. El embargo puede excluir un tramo posterior a la prueba cuando el diseño de validación cruzada admite datos de entrenamiento posteriores. Busca limitar dependencias residuales, por ejemplo las debidas a ventanas de información solapadas. Un walk-forward estrictamente causal no entrena con esas observaciones futuras; un intervalo de exclusión anterior a la prueba es un gap. Su duración y sus límites dependen de las etiquetas, la disponibilidad de los datos y las ventanas de las variables. No existe un número universal de días.

Estas exclusiones no corrigen datos publicados con retraso, normalizaciones ajustadas con todo el conjunto ni selecciones repetidas sobre la prueba. Conserva las filas excluidas y los motivos, incluye un ejemplo defectuoso que la comprobación deba detectar y registra qué resultados habías visto antes de decidir.

Pruébalo sobre el papel: una fila empieza en el periodo 4 y su resultado termina en el 6. ¿Puedes usarla para entrenar un modelo que decide al comienzo del 5? No. Cambia ahora el final del resultado al periodo 4: ese solapamiento desaparece, pero aún hay que comprobar la disponibilidad de las variables y el historial de selección.

Para la separación cronológica y el parámetro gap, consulta la documentación oficial de TimeSeriesSplit. Para el riesgo de seleccionar entre muchos backtests, consulta a Bailey y sus coautores. Ninguna de estas referencias certifica este proyecto ni garantiza resultados futuros.

scikit-learn: TimeSeriesSplit · Bailey et al.: The Probability of Backtest Overfitting

Un archivo idéntico puede seguir incompleto

Una comprobación de integridad puede confirmar que tienes el archivo previsto. También puede confirmar, con total exactitud, que has reproducido el mismo hueco informativo.

Nuestras auditorías exigieron separar tres comprobaciones: identidad del archivo, cobertura de los datos e historial realmente disponible para calcular los indicadores. Cada una responde a una pregunta diferente.

Ejemplo sintético · No representa resultados de Quantic Eagle

Tres situaciones que conviene distinguir

— Tramo inicial previsto · ✓ Disponible · ! Hueco inesperado

Datos sintéticos: dos ausencias previstas, tres valores presentes y un hueco que investigar.

Las primeras observaciones de un indicador pueden faltar por una razón prevista. Un hueco inesperado meses después exige investigar. Eliminar todas las filas incompletas puede ocultar la diferencia y modificar la muestra.

Convertir la experiencia en algo que puedas usar

Un asistente de IA puede explicar estos conceptos. Para reconstruir fielmente las decisiones, las pruebas y las comprobaciones de nuestro archivo privado necesita acceder a esos materiales. El trabajo de esta edición consiste en seleccionar y explicar parte de esa experiencia, y convertirla en procedimientos utilizables sin distribuir las configuraciones propietarias.

Cada caso sigue una secuencia: qué queríamos averiguar, qué parecía cierto, qué comprobación cambió la lectura y qué puede aplicar el lector. También se explican las decisiones de detener una línea de investigación.

Volver a empezar aborda el siguiente paso: cómo organizar hoy un laboratorio didáctico pequeño, con una idea, una referencia sencilla, datos utilizables, tareas acotadas para los agentes y resultados verificables. El objetivo es evitar pruebas innecesarias. El tiempo que puedas ahorrar dependerá de tu punto de partida y de cómo uses el material.

Seis respuestas antes del próximo experimento

Tres episodios explican por qué hemos decidido abrir una parte del laboratorio.

Las probabilidades coincidían. Las órdenes podían cambiar.

Una auditoría había verificado los modelos, datos y predicciones de una simulación. Una comprobación posterior encontró una diferencia en el componente que resolvía conflictos entre direcciones. La simulación recorría efectivamente esa rama. Se retiró la calificación de réplica exacta y se conservó el resultado como evidencia diagnóstica.

Esquema didáctico · No representa resultados de trading

Dónde divergen los recorridos

Dónde divergen los recorridosPuntuaciones iguales. Decisiones distintas. Carteras distintas. Comprueba el recorrido entre predicción y orden.
01Puntuaciones iguales
02Decisiones distintas
03Carteras distintas
Comprueba el recorrido entre predicción y orden.

La conclusión práctica sorprende: modelos idénticos pueden producir carteras distintas. Entre predicción y orden están prioridades, capacidad y gestión. Una plaza ocupada ahora cambia qué oportunidades pueden admitirse después. Verificar la réplica exige seguir la decisión a lo largo de toda la cadena.

El manual explica cómo localizar la primera divergencia y decidir qué cálculos pueden reutilizarse. Repetirlo todo no siempre es necesario; conservarlo todo sin distinguir dependencias puede resultar igualmente equivocado.

El agente analizaba varias veces los mismos objetos

Un componente de IA recibía la lista global de candidatos en cada lote pequeño. Las respuestas se concatenaban sin controles completos de ámbito y unicidad. La duplicación empezaba en el contrato de datos, antes de evaluar la calidad del razonamiento.

Con doce objetos en cuatro lotes, la prueba es sencilla: cada objeto debe pertenecer a su lote, una sola vez. No hace falta pagar por usar un modelo para comprobarlo. Hacen falta identificadores, respuestas simuladas y un procesador que rechace lo que quede fuera del ámbito.

La pregunta económica viene después: ¿se guardó información suficiente para saber si el componente ayudaba? En el caso interno, no. El gasto era real y las pruebas conservadas no permitían demostrar el beneficio; se suspendió el componente. Esa decisión forma parte de la experiencia que merece compartirse tanto como una solución que ha funcionado.

El informe frenaba lo que contaba

Una cola de investigación tenía cachés y procesos paralelos. Sin embargo, generar el informe dentro del ciclo de admisión retrasaba la entrada de nuevos trabajos. El sistema parecía preparado para trabajar en paralelo mientras una función auxiliar introducía esperas.

Para quien dirige un laboratorio pequeño con IA, automatizar también significa separar responsabilidades, definir quién escribe y verificar una recuperación sin duplicar trabajo. Un panel elegante no demuestra avance. Lo demuestran resultados completos, comprobados y recuperables.

La comprobación que puedes llevarte

  1. ¿Qué información estaba disponible al tomar la decisión?
  2. ¿Qué resultados habías consultado antes de seleccionar el modelo?
  3. ¿La curva trata de forma coherente posiciones abiertas, costes y movimientos de capital?
  4. ¿La comparación cambia una sola cosa o varias condiciones a la vez?
  5. ¿Otra persona puede reproducir el resultado con el material conservado?
  6. ¿Qué resultado te haría descartar la hipótesis?

Las respuestas pendientes indican dónde trabajar. No califican tu capacidad ni certifican una estrategia.

De la lectura a tu propio laboratorio

Antes de arriesgar capital — Protocolo de verificación de la investigación conecta veinte capítulos y los casos del laboratorio con siete comandos Python para revisar el drawdown observado, las contradicciones temporales, las particiones temporales con purgado, las clasificaciones, las trazas de decisión, los lotes y las ventanas de observación. Cada comando utiliza archivos CSV o JSON según su formato documentado. Incluye un notebook reproducible, pruebas, doce fichas y encargos para agentes. La entrega prevista es un paquete en el idioma que elijas: español, inglés o italiano.

Cada recorrido parte de un problema, ofrece un comando y muestra el resultado esperado. Primero reproduces el ejemplo; después conectas una copia de tus datos. El informe conserva los hashes de los archivos de entrada, la versión y los parámetros. El encargo al agente también exige un contraejemplo: una explicación convincente se convierte en una afirmación que puedes poner a prueba.

No necesitas compartir tu estrategia con nosotros. Explora el contenido de la guía y empieza por el caso que reconozcas en tu trabajo.

El objetivo es terminar con un dosier que puedas entender, reproducir y cuestionar. El material no incluye señales de trading, modelos propietarios ni garantías de ingresos.

La guía está en preparación. Los recursos de este sitio son gratuitos. Puedes pedir un único correo cuando esté lista; no se admiten compras ni reservas. Avísame cuando esté lista.

Fuentes y alcance

El caso de los 192 backtests procede de investigación interna de Quantic Eagle del 16 de septiembre de 2026, sin auditoría independiente. Las demás figuras son conceptuales o sintéticas. Los diez años describen el recorrido de investigación declarado por el fundador, anterior a la sociedad, no diez años de resultados en operativa real.

Sobre la selección entre múltiples backtests: Bailey et al., The Probability of Backtest Overfitting. Quantic Eagle opera con capital propio y no capta ni gestiona fondos de terceros. Este contenido ofrece formación metodológica general, no recomendaciones de inversión.

El museo de los falsos verdes

Dos programas devuelven probabilidades idénticas. Uno elige A; el otro, B. Dos lotes devuelven JSON válido, pero repiten los mismos objetos. Una variable es un número finito, aunque su ventana tiene un hueco. Tres resultados tranquilizadores; tres preguntas sin responder.

En el Museo de los falsos verdes puedes mostrar cada fallo y aplicar su corrección. Las figuras sintéticas se pueden descargar para explicar a un compañero por qué superar una comprobación no equivale a demostrar una conclusión. No hace falta registrarse.

A menudo, lo más útil de la experiencia es saber dónde termina una prueba. Las puntuaciones pueden coincidir exactamente sin que se haya revisado la selección. Un hash correcto puede identificar datos incompletos. Un agente puede cumplir el encargo sin que se haya medido su aportación económica.

El protocolo completo añade seis talleres, tres comprobaciones del flujo de trabajo y un dosier que reúne hallazgos, referencias de los archivos utilizados y controles pendientes. Cada contraejemplo tiene una versión corregida: primero exigimos que la herramienta las distinga y después la aplicamos a nuestros datos.

Si tus observaciones de equity usan otros nombres de columna, el conversor local de columnas ayuda a prepararlas. Si solo tienes operaciones cerradas, no inventa la curva que falta. Ese límite forma parte del producto: identificar qué falta por comprobar antes de sacar conclusiones.

Convierte tu próxima idea en un plan de investigación.

Una guía práctica con veinte capítulos, seis talleres, explicaciones visuales, doce fichas y siete herramientas Python. Experiencia que puedes estudiar, procedimientos que puedes adaptar y un proyecto que desarrollar con criterio.

Explora el recorrido · El museo de los falsos verdes

De la hipótesis a la decisión: dos casos ya descritos

Hipótesis
Las probabilidades iguales demuestran una réplica exacta.
Comprobación
Revisar también cómo se resuelven los conflictos entre direcciones.
Resultado observado
La simulación recorría una rama distinta.
Decisión
Se retiró la calificación de réplica exacta y se conservó su valor diagnóstico.
Hipótesis
Las respuestas válidas demuestran que el componente de IA ayuda.
Comprobación
Comprobar asignaciones, duplicados y pruebas del beneficio.
Resultado observado
Objetos repetidos y pruebas insuficientes de un beneficio que justificara el coste.
Decisión
Se suspendió el componente. La validez del JSON y la utilidad económica siguen siendo cuestiones distintas.

Síntesis de observaciones internas ya descritas en el artículo, sin auditoría independiente. No añade medidas de rentabilidad ni resultados nuevos.

La guía está en preparación. Los recursos de este sitio son gratuitos. Puedes pedir un único correo cuando esté lista; no se admiten compras ni reservas.

Avísame cuando esté lista

Elaborado por Quantic Eagle LTD · Formación general sobre investigación. Quiénes somos.

Volver arriba