La IA está ‘imprimiendo dinero’ en cripto. Cincuenta experimentos pre-registrados no lo encuentran.
- Publicado
- 26 de agosto de 2026
- Actualizado
- 1 de septiembre de 2026
- Lectura
- 6 min
- Temas
- investigación cuantitativa · cripto · trading con IA · estadística
Hay un género de captura de pantalla circulando: un modelo de IA, una cuenta de trading, un número en verde. Que si Claude le hizo diez mil dólares a alguien en una noche; que si un bot va +22% en dos semanas; que si un portafolio ‘le gana al S&P’. Mientras tanto, en una computadora pequeña que corre experimentos controlados contra datos reales del mercado cripto, la misma pregunta sigue devolviendo la misma respuesta. Esta página trata de esa brecha — y va a seguir tratando de ella, en público y con fuentes.
01Qué dicen de verdad los números virales
La evidencia más citada es Alpha Arena, un benchmark en vivo que le entregó a seis modelos de lenguaje $10,000 reales a cada uno para operar perpetuos de cripto en el otoño de 2025 [1]. Capital real, mercado real, autonomía total — hay que reconocerlo: es un experimento genuino. El marcador final: Qwen3 Max terminó alrededor de +22%, DeepSeek ligeramente positivo, y todos los demás perdieron dinero. Claude Sonnet 4.5 devolvió más del 40% de su capital, y en algún punto los modelos occidentales insignia llegaron a perder 80% en una semana [3][4].
Entonces alguien hizo lo menos glamoroso: correr la estadística. Una replicación independiente sometió las comparaciones entre modelos a tests de significancia y encontró que exactamente una de seis superaba p<0.05 [2]. Una. La industria leyó la tabla como ‘la IA sabe tradear’. La aritmética la lee como un torneo pequeño en el que alguien tenía que quedar primero [5][6].
El resto del género es más flaco todavía. Un ‘experimento de $100K’ donde tres de cinco estrategias escritas por IA le ganaron al S&P en noventa días — cinco estrategias, un trimestre: eso es una mano de cartas, no un track record [8]. Un ‘portafolio Claude’ +19% contra el índice, citado en todas partes menos junto al dato de que es el embudo de ventas de un producto de copy-trading — el retorno es el anuncio [9]. Y un océano de capturas sin benchmark, sin costes, y sin manera de contar cuántas capturas perdedoras nunca se publicaron.
Una quincena al +22% no es evidencia de habilidad. Es una moneda al aire con buena iluminación.
02Por qué las ventanas cortas no prueban nada
Los retornos de mercado son tan ruidosos que la habilidad y la suerte son estadísticamente indistinguibles en semanas. Las barras de error de una medida de desempeño se encogen con la raíz cuadrada del tiempo, y en una ventana de dos semanas son más anchas que cualquier efecto que se esté afirmando. Pon ocho modelos en un bracket y uno de ellos va a ‘ganar con autoridad’ todas y cada una de las veces. Eso no es inteligencia; es lo que hacen los brackets.
Suma tres sesgos silenciosos y el género se escribe solo. Supervivencia: las cuentas que pierden no tuitean. Beta disfrazada de alpha: estar comprado en lo que sea durante un mercado que sube produce un número verde que no requirió inteligencia, artificial ni de la otra. Y los costes: comisiones, slippage y funding convierten calladamente muchos edges de papel en pérdidas reales.
Nada de esto demuestra que los ganadores tuvieron suerte. Demuestra que todavía nadie puede saberlo — y ‘nadie puede saberlo’ no vende thumbnails.
03Otra manera de hacer la pregunta
El experimento que sigue esta página corre en una Raspberry Pi: un sistema de investigación autónomo, apuntado a los quince futuros perpetuos más líquidos de un exchange, con cinco años de datos de precio a resolución de minuto. Hardware deliberadamente modesto, mercados deliberadamente líquidos — si un edge solo existe en un par demasiado fino para operarlo de verdad, no es un edge, es un error de redondeo.
Las reglas son el punto. Cada hipótesis se pre-registra antes de escribir una línea de código: el mecanismo económico, los umbrales exactos que la validarían y el resultado que la falsificaría, todo fijado por adelantado. Para sobrevivir, una estrategia tiene que superar un test de permutación a p<0.01, sostenerse en datos out-of-sample con walk-forward, aguantar el deflated Sharpe ratio — la corrección por ‘probaste muchas cosas y publicaste la mejor’ [7] — y ganarle a la alternativa más tonta posible: mantener los mismos activos equiponderados, neto de costes. Falla una puerta y la hipótesis se retira, por escrito.
La misión es simétrica, y está escrita dentro del sistema: un edge validado, o una conclusión bien documentada de que no lo hay. Las dos cuentan como éxito. Esa frase trabaja más de lo que aparenta — elimina el incentivo de torturar los datos hasta que confiesen.
04Cincuenta hipótesis después
El marcador hasta ahora: cincuenta y una hipótesis pre-registradas, cincuenta y una falsificadas. Momentum, reversión, momentum idiosincrático beta-neutral, una prima de iliquidez, diseños sobre funding, imbalance del libro de órdenes — ocho mecanismos económicos distintos en la familia precio-volumen de uno a siete días, cada uno testeado con potencia estadística real, cada uno muerto con su p-value en el registro.
Por el camino el sistema midió el telón de fondo que las capturas nunca mencionan: cripto long-only en este universo rinde un Sharpe de alrededor de 0.44 con drawdowns cercanos al 80%. Eso es la clase de activo. Un bot que estuvo comprado durante una buena racha ‘ganó dinero’ como quien se moja por pararse bajo la lluvia.
En agosto la familia se cerró formalmente en lugar de probar una novena variante, porque una novena variante sin una razón económica nueva es exactamente el p-hacking que las reglas existen para impedir. Desde entonces se ha reabierto exactamente una vez, para un mecanismo de la literatura académica que sí traía una razón nueva — la autopsia está en los reportes de campo de abajo. La frase más útil de la investigación cuantitativa es ‘esto no funciona, y aquí está la prueba’. También es la menos retuiteada.
05Qué cambiaría la respuesta
Tres cosas, todas en marcha. Primera, potencia estadística: las señales de microestructura — open interest, ratios de posicionamiento, profundidad del libro, flujo de liquidaciones — necesitan cerca de un año de historia antes de que un test sobre ellas signifique algo, y la mayoría de esos colectores llevan meses. Un hallazgo reciente acorta la espera considerablemente: el archivo público del exchange guarda open interest y posicionamiento a resolución de cinco minutos desde 2020, lo que desbloquea años de potencia de test para la siguiente familia en cuanto se verifique contra la captura en vivo.
Segunda, un sustrato distinto. Todo lo falsificado hasta ahora es precio y sus derivados — el dataset más minado de las finanzas. La información es otra pregunta: noticias, reportes, flujos, lo que un analista lee de verdad. Si un modelo de lenguaje tiene edge real ahí se está midiendo bajo la misma disciplina — tesis registradas antes del desenlace, calificadas por calibración, solo hacia adelante, porque a un LLM no se le puede backtestear honestamente sobre un pasado que ya memorizó.
Tercera, simplemente: evidencia. Si algo supera las puertas algún día, se publicará aquí con los umbrales que tuvo que superar declarados por adelantado — lo que significa que, por una vez, vas a poder verificarlo.
06En qué se convierte esta página
Debajo de este artículo se irán acumulando reportes de campo: más o menos semanales cuando haya algo real, más callados cuando no. Hallazgos, falsificaciones y, de vez en cuando, la autopsia de alguna afirmación viral, cada uno con sus fuentes listadas al final.
Si una captura dice que un modelo convirtió $10,000 en $12,000, la pregunta interesante nunca es la captura. Es: ¿sobre cuántas apuestas independientes, contra qué benchmark, neto de qué costes, seleccionada entre cuántos intentos que nadie publicó? Esa pregunta también cabe en un tuit. Solo que ahí nunca se hace.
Fuentes numeradas a las que apunta el texto. El orden se fija al publicar — es parte del artículo.
- Nof1
- GitHub — Eug-Chua/llm_trading_arena
- Bitcoin Magazine
- iWeaver
- Boris Again (Substack)
- arXiv
- SSRN — Bailey & Lopez de Prado
- PickMyTrade
- explainx.ai
Hallazgos de la investigación en curso, del más reciente al más antiguo. Se publican cuando hay algo real que contar — no por calendario.
- 01Novedad1 de septiembre de 2026
Llegó más potencia estadística. Los funerales se aceleraron.
Cada señal archivada como ‘faltan datos’ se re-evaluó con hasta 124x más muestra: todas muertas, una con el signo invertido, y la anomalía famosa también cayó.
- quant-research
- statistical-power
- statistics
- crypto
5 minLeer - 02Novedad26 de agosto de 2026
Seis años de open interest estaban guardados en un archivo público
La siguiente familia de experimentos necesitaba un año de recolección de datos. Un archivo público del exchange resulta que guarda casi todo desde 2020 — verificado, con límites.
- open-interest
- data-archaeology
- statistical-power
2 minLeer