¿Puede una IA pasar un challenge? Resultados de Alpha Arena


¿Puede una IA operar por ti? La prueba más clara se hizo en otoño de 2025, en el experimento Alpha Arena. Seis de los mayores modelos de lenguaje — GPT-5, Claude Sonnet 4.5, Gemini 2.5 Pro, Grok 4, DeepSeek V3.1 y Qwen3 Max — recibieron $10,000 de dinero real cada uno y operaron criptomonedas durante 17 días sin intervención humana. Cuatro modelos terminaron con pérdidas de entre el 42% y el 59%. Los dos rentables, Qwen3 Max (+22.3%) y DeepSeek V3.1 (+4.9%), duplicaron su cuenta en los primeros diez días, pero en pocos días devolvieron al mercado más de la mitad de lo ganado. Según nuestra estimación, en un challenge de prop trading esos días habrían superado el límite estándar de drawdown diario y la cuenta se habría cerrado junto con todo el profit. A continuación analizamos qué pasó, qué dicen los estudios científicos y qué conclusión debe sacar un trader.
Este es un análisis de hechos: las cifras del experimento, los estudios científicos y nuestro cálculo con las reglas del challenge. Para saber cómo usar la IA en tu propia operativa, lee nuestra guía «Cómo operar con IA».
Qué es Alpha Arena

Alpha Arena es un experimento de la empresa de investigación estadounidense Nof1. Ponía a prueba una pregunta sencilla: ¿puede un modelo de lenguaje de uso general, el mismo con el que chateas, operar por sí solo en un mercado real? Los modelos no operaron con datos históricos ni en un simulador, sino con dinero real, y cada error costaba dólares de verdad.
Condiciones del experimento
| Parámetro | Condición |
|---|---|
| Participantes | GPT-5, Claude Sonnet 4.5, Gemini 2.5 Pro, Grok 4, DeepSeek V3.1, Qwen3 Max |
| Capital | $10,000 de dinero real para cada modelo |
| Mercado | Futuros perpetuos en el exchange descentralizado Hyperliquid |
| Activos | BTC, ETH, SOL, XRP, DOGE, BNB |
| Periodo | Del 18 de octubre al 3 de noviembre de 2025 |
| Papel humano | Ninguno: los modelos decidían qué comprar, con qué apalancamiento y cuándo salir |
Todos los modelos recibían las mismas instrucciones y los mismos datos: precios, indicadores y el estado de su propia cuenta. No podían conectarse a internet ni leer noticias. Lo único que cambiaba eran las decisiones de cada modelo.
En qué se diferencia de una prueba normal
La mayoría de las pruebas de IA en trading son backtests: el modelo «opera» con datos históricos. Los autores del estudio LiveTradeBench señalan el principal problema de este enfoque: la fuga de información. El modelo pudo haber visto esos datos durante su entrenamiento y, en ese caso, no pronostica, sino que recuerda. En Alpha Arena no había ese atajo: los modelos operaban en tiempo real, en un mercado cuyo futuro nadie conocía, y todas las operaciones eran públicas.
Resultados de la primera temporada

La temporada terminó el 3 de noviembre de 2025. Los resultados finales los publicó el fundador de Nof1 y los recoge ForkLog:
| Puesto | Modelo | Balance final | Resultado |
|---|---|---|---|
| 1 | Qwen3 Max (Alibaba) | $12,231 | +22.3% |
| 2 | DeepSeek V3.1 | $10,489 | +4.9% |
| 3 | Claude Sonnet 4.5 (Anthropic) | $5,799 | −42.0% |
| 4 | Gemini 2.5 Pro (Google) | $5,445 | −45.6% |
| 5 | Grok 4 (xAI) | $4,208 | −57.9% |
| 6 | GPT-5 (OpenAI) | $4,126 | −58.7% |
Las páginas oficiales de la primera temporada en la web de Nof1 ya no están disponibles, así que nos basamos en las cifras que publicó el fundador del proyecto. En los medios aparecen valores algo distintos, por ejemplo para GPT-5, pero eso no cambia la clasificación ni la conclusión general.
De los seis modelos, dos ganaron dinero. Los otros cuatro perdieron casi la mitad de la cuenta o más. Pero la tabla solo muestra la meta, y lo importante de esta historia es el camino hasta ella.
Los ganadores: subir a la cima y volver a bajar
Para el 27 de octubre, el décimo día de la temporada, los dos futuros ganadores habían duplicado su cuenta. Según el South China Morning Post, DeepSeek llegó a $22,900 (+126%) y Qwen a $20,850 (+108%).
Después, el mercado se llevó casi todo. En la semana siguiente, DeepSeek perdió más de la mitad de su balance y Qwen retrocedió un 41% desde su máximo.
| Modelo | Balance el 27 de octubre | Final el 3 de noviembre | Caída desde el máximo |
|---|---|---|---|
| DeepSeek V3.1 | $22,900 | $10,489 | −54% |
| Qwen3 Max | $20,850 | $12,231 | −41% |
Los ganadores tenían estilos muy distintos. PANews analizó las operaciones de los modelos durante los primeros nueve días. DeepSeek operaba como un trader de tendencia paciente: solo 17 operaciones, una media de 49 horas en posición, stops pequeños y objetivos de profit amplios. Qwen se comportaba como un apostador: solía mantener una sola posición, apostaba fuerte en ella y a menudo usaba un apalancamiento de 25×, el máximo permitido en la competición.
Para entender lo peligroso que es ese apalancamiento basta con una cuenta sencilla. Con 25×, un movimiento del precio del 4% en contra de la posición se lleva el 100% del margen invertido en ella. En cripto, un movimiento del 4% es un día de lo más normal. Mientras el mercado subía, el apalancamiento multiplicaba el profit. Cuando el mercado giró, multiplicó también las pérdidas.
Por tanto, el «ganador» de Alpha Arena es el modelo que devolvió al mercado menos de lo ganado que los demás. La rentabilidad final oculta lo más importante: lo profundo que cayó la cuenta por el camino. Para un trader de prop trading, eso lo decide todo. Volveremos a ello en el cálculo de más abajo.
Los perdedores: demasiadas operaciones
Los rezagados tenían otro problema, y es sorprendente: no asumían demasiado riesgo. Según PANews, GPT-5 y Gemini usaban un apalancamiento medio por posición inferior a 1×. Lo que les falló fue la frecuencia.
Para el 27 de octubre, Gemini había hecho 165 operaciones y había gastado más de $1,000 solo en comisiones. Salía con el menor profit y con la menor pérdida, y cada operación iba mermando la cuenta. GPT-5 hizo 63 operaciones, de las que solo alrededor del 20% fueron rentables. Ambos solían entrar al mercado más tarde que los líderes, cuando el movimiento ya había pasado.
El resultado: dos errores opuestos que cualquier trader conoce. A los líderes les falló el exceso de apalancamiento; a los rezagados, el sobretrading. Por eso repetimos a los traders que un apalancamiento alto es matemáticamente incompatible con los límites de drawdown, y que operar a menudo sin ventaja solo alimenta las comisiones. Un apalancamiento de alrededor de 5× es una elección consciente: con él, una sola operación fallida no destruye la cuenta.
El «carácter» de las IA
Al hacer balance, el fundador de Nof1, Jay Azhang, señaló que los modelos mostraron tendencias estables, que se mantuvieron durante toda la temporada y tras muchos cambios en las instrucciones. En sus palabras, se parecía a una «personalidad» inversora.

En la práctica, cada modelo repetía su estilo una y otra vez, incluso cuando dejaba de funcionar. Qwen seguía apostándolo todo a una sola posición con mucho apalancamiento, y Gemini seguía abriendo decenas de operaciones pequeñas. Es lo mismo que hace un trader que repite el mismo error una y otra vez.
Segunda temporada: otro mercado, otro líder
A finales de 2025, Nof1 organizó la Season 1.5. Esta vez ocho modelos operaron acciones estadounidenses en cuatro competiciones paralelas. Según los resultados publicados, el primer puesto fue para otro modelo, no para el ganador de la primera temporada. Es un argumento más: el éxito en un experimento corto no se traslada automáticamente a otro mercado ni a otro periodo.
¿Pasarían las IA un challenge de prop trading? Nuestro cálculo
La rentabilidad final de Alpha Arena responde a la pregunta «quién ganó más». A un trader le importa otra pregunta: ¿podría el modelo operar en una cuenta con reglas de riesgo? Para responderla, comparamos los resultados de los modelos con las reglas del challenge de Upscale. Son reglas típicas del prop trading, así que la conclusión vale también fuera de nuestra plataforma.
Las reglas que comprobamos
| Formato | Límite diario | Límite de drawdown total |
|---|---|---|
| Básico | 5% del balance al inicio del día | 10% del balance inicial |
| Acelerado | 3% del balance al inicio del día | 6% del balance inicial |
| Turbo | no se aplica | 6% del balance máximo |
Dos detalles importantes. El balance incluye las posiciones abiertas: una pérdida que aún no se ha cerrado también reduce el balance. Y el día de trading empieza a las 00:00 UTC, con el límite diario reiniciándose cada día. Más información en las reglas del challenge.
Resultado por modelo
| Modelo | Límite total (Básico, Acelerado) | Límite diario (Básico, Acelerado) | Límite desde el máximo (Turbo) |
|---|---|---|---|
| Qwen3 Max | probablemente no superado | superado | superado: −41% desde el máximo |
| DeepSeek V3.1 | probablemente no superado | superado | superado: −54% desde el máximo |
| Claude, Gemini, Grok, GPT-5 | superado: terminaron por debajo de $9,000 | ya no importa | superado |
Con los cuatro perdedores todo es sencillo: una cuenta que perdió entre el 42% y el 59% se habría cerrado con cualquier regla. Más interesantes son los dos modelos rentables. Lo más probable es que no hubieran superado el límite total desde el balance inicial: en los primeros días estaban en positivo y terminaron por encima de $10,000. Lo que los habría frenado es el límite diario.
Cómo lo calculamos

El historial completo del balance minuto a minuto no es público, así que nos basamos en los valores publicados: el máximo del 27 de octubre y el final del 3 de noviembre. Es suficiente para sacar una conclusión. Lo mostramos con el ejemplo de DeepSeek.
Supongamos que, del 28 de octubre al 3 de noviembre, DeepSeek nunca perdió más del 5% en un día. Entonces, en esos siete días su balance podría haber bajado como mucho hasta el 70% de su nivel al inicio del 28 de octubre (0.95 elevado a siete ≈ 0.70). El modelo terminó con $10,489, así que al inicio del 28 de octubre habría tenido como máximo $15,020.
Pero el 27 de octubre el balance de DeepSeek era de $22,900. Eso significa que en un solo día, el 27 de octubre, tendría que haber perdido alrededor del 34%. En cualquiera de los dos casos, el límite diario se supera. El mismo cálculo para Qwen da una caída de al menos el 16% en un día.
Por qué duplicar la cuenta no los habría salvado
Parece lógico: si el modelo duplicó la cuenta, tiene mucho margen. Pero el límite diario se comprueba cada día, no solo al principio. Cuando el balance subió a $22,900, el 5% equivalía a unos $1,145. Y los modelos perdían miles de dólares en un día.
Cuando se supera el límite, la cuenta se cierra de inmediato y se anula todo el profit acumulado. Los modelos no retiraban dinero, así que habrían perdido todas sus ganancias de golpe. Si un trader con una cuenta fondeada hubiera solicitado un payout cerca del máximo, la parte retirada se habría conservado. Pero la IA no piensa en eso por sí sola: es una decisión humana.
Ese es el sentido del límite diario. No castiga al trader, sino que lo detiene el día en que todo sale mal, antes de que un mal día se convierta en la pérdida de toda la cuenta.
Limitaciones del cálculo
Es una estimación, no una simulación exacta. Superponemos la trayectoria del balance a los límites de riesgo, pero no recorremos las fases del challenge: en un challenge real, las posiciones se cierran al pasar a la siguiente fase y la operativa posterior habría sido distinta. Además, solo tenemos capturas puntuales del balance, no el historial completo minuto a minuto. La conclusión no cambia: días con pérdidas así son incompatibles con un límite diario del 5%.
Qué dicen los estudios científicos
Alpha Arena es un único experimento de 17 días. Los investigadores han puesto a prueba a traders de IA durante más tiempo y en otros mercados. Estos son los principales estudios del último año y sus conclusiones en palabras sencillas.
| Estudio | Qué se probó | Qué se descubrió |
|---|---|---|
| StockBench (ICLR 2026) | Trading de acciones del índice Dow Jones, marzo–julio de 2025 | La mayoría de los agentes de IA no superó la simple estrategia de «comprar y mantener». Las buenas notas en tests financieros no se traducen en trading rentable |
| FINSABER (KDD 2026) | 20 años de historia, más de 100 acciones | A largo plazo, la ventaja de las estrategias de IA desaparece: son demasiado prudentes en mercados alcistas y demasiado agresivas en los bajistas |
| LiveTradeBench (Universidad de Illinois) | 50 días de trading en vivo, 21 modelos | El puesto de un modelo en los rankings generales de «inteligencia» casi no tiene relación con sus resultados de trading |
| Agent Market Arena | Trading en vivo de cripto y acciones | Los agentes de IA pueden operar con beneficios y superar a «comprar y mantener», pero el resultado depende más de cómo está construido el agente que del modelo elegido |
| AlphaForgeBench | Estabilidad de las decisiones | El mismo modelo, en condiciones idénticas, daba resultados notablemente distintos de una ejecución a otra |
El panorama es este: la IA puede operar en positivo en determinados periodos, pero todavía no se ha demostrado una ventaja estable sobre el mercado. Y donde los agentes obtuvieron buenos resultados, lo decisivo no fue la «inteligencia» del modelo, sino las reglas con las que operaba.
Por qué un modelo «inteligente» no es necesariamente un buen trader
Un modelo de lenguaje aprendió de textos: explica muy bien qué es el apalancamiento o una tendencia, pero eso no significa que sepa gestionar el riesgo. El fundador de Nof1 señaló que los modelos de lenguaje no manejan bien las series temporales numéricas, y un gráfico de precios es justamente eso.
Hay un segundo problema. Un modelo responde de forma distinta a la misma pregunta, y en el trading esa aleatoriedad se convierte en operaciones aleatorias. Una persona puede desarrollar disciplina; un modelo sigue exactamente las reglas que se le han dado, y nada más.
Qué significa esto para el trader

¿Puede la IA operar por ti?
Técnicamente, sí: una IA ya puede abrir y cerrar operaciones sin intervención humana. Pero hoy no hay pruebas de que lo haga de forma rentable y estable respetando los límites de riesgo. Los experimentos muestran lo contrario: los modelos ganan en una buena racha y devuelven lo ganado cuando el mercado gira.
Eso no significa que la IA sea inútil en el trading. Funciona bien como asistente: analiza noticias, ayuda a escribir y revisar código y analiza tus operaciones. Los cinco niveles de uso de la IA en el trading, desde analista hasta agente autónomo, los explicamos en nuestra guía «Cómo operar con IA».
Los límites de riesgo van en el código, no en las instrucciones del modelo
Si automatizas tu operativa, la principal lección de Alpha Arena es sencilla: no puedes confiar en que el modelo se detenga solo. El apalancamiento máximo, el tamaño de la posición y el stop diario deben estar programados como reglas fijas en un software que la IA no pueda saltarse. Cómo conectar un bot al challenge y qué reglas se aplican al trading automatizado lo explicamos en el artículo «Trading por API».
Las personas cometen los mismos errores
Demasiado apalancamiento, sobretrading, intentar recuperar una pérdida: no son errores exclusivos de la IA. Si tu challenge se ha cerrado, el análisis con IA del challenge en tu dashboard te mostrará las estadísticas de todas tus operaciones, tus tres errores principales y un plan de mejora para cada uno. Es un buen ejemplo de para qué sirve la IA en el trading: no para adivinar el mercado, sino para ayudar a una persona a ver sus propios errores.
Por dónde empezar si quieres operar con IA
Empieza por tareas en las que un error de la IA no cueste nada: pídele que te explique un término desconocido, que analice una noticia o que revise una exportación de tus operaciones pasadas. El siguiente paso es el código. La IA puede ayudarte a escribir un indicador o un bot sencillo, pero ejecuta las primeras versiones solo en una cuenta demo y nunca pegues tu API key en el chat. Pasa a un challenge real solo cuando la estrategia haya funcionado en demo y los límites de apalancamiento, tamaño de posición y pérdida diaria estén programados en el código. Cada uno de estos pasos se explica en detalle en nuestra guía «Cómo operar con IA».
Un experimento corto no demuestra que una IA sepa operar. En los 17 días de Alpha Arena, dos de los seis modelos ganaron dinero, pero ambos devolvieron al mercado más de la mitad del profit por el camino. En la segunda temporada, en otro mercado, el líder cambió. Los estudios científicos confirman el mismo panorama: la IA todavía no tiene una ventaja estable sobre el mercado.
Lo decisivo no es la «inteligencia» del modelo, sino las reglas con las que opera. Los modelos perdieron dinero no por falta de conocimientos, sino por errores en la gestión del riesgo: a los líderes les falló el apalancamiento alto; a los rezagados, el sobretrading y las comisiones. Donde los agentes de IA obtuvieron buenos resultados, lo más importante fue cómo estaba construido el agente y los límites de riesgo integrados en él.
Para un trader en un challenge, la conclusión es práctica. Usa la IA como asistente —para analizar, programar y revisar tus operaciones—, no como piloto automático. Si automatizas tu operativa, los límites de apalancamiento, tamaño de posición y pérdida diaria deben estar programados en el código. El límite de drawdown diario funciona igual: detiene la operativa en un mal día, antes de que un día perdido se convierta en una cuenta perdida.
Empieza ahora: 👉 Upscale.trade | Bot de Telegram
Síguenos: 📺 YouTube | 𝕏 Twitter
Comunidad: 💬 Chat de Telegram | 🎮 Discord
¿Qué es Alpha Arena?
Alpha Arena es un experimento de la empresa de investigación Nof1 en el que modelos de lenguaje operaron con dinero real sin intervención humana. En la primera temporada, del 18 de octubre al 3 de noviembre de 2025, seis modelos —GPT-5, Claude Sonnet 4.5, Gemini 2.5 Pro, Grok 4, DeepSeek V3.1 y Qwen3 Max— recibieron $10,000 cada uno y operaron futuros perpetuos de criptomonedas en el exchange Hyperliquid. Todos recibían las mismas instrucciones y los mismos datos.
¿Qué IA ganó Alpha Arena?
La primera temporada la ganó Qwen3 Max, de Alibaba: terminó con $12,231, un +22.3%. El segundo puesto fue para DeepSeek V3.1, con un +4.9%. Los otros cuatro modelos terminaron en negativo: Claude Sonnet 4.5 (−42.0%), Gemini 2.5 Pro (−45.6%), Grok 4 (−57.9%) y GPT-5 (−58.7%). En la segunda temporada, con acciones estadounidenses, ganó otro modelo.
¿Por qué la mayoría de los modelos de IA perdieron dinero?
El principal problema de los rezagados fue el sobretrading. Según PANews, Gemini hizo 165 operaciones en nueve días y gastó más de $1,000 en comisiones, y solo alrededor del 20% de las operaciones de GPT-5 fueron rentables. Su apalancamiento era bajo. A los líderes, en cambio, les falló el apalancamiento alto: Qwen operaba a menudo con 25× y, cuando el mercado giró, los dos modelos rentables devolvieron más de la mitad de lo ganado.
¿Puede una IA pasar un challenge de prop trading?
Por ahora no hay pruebas de ello. Según nuestra estimación, incluso los dos modelos rentables de Alpha Arena habrían superado el límite estándar de drawdown diario del 5%: algunos días perdían el 15% del balance o más. Cuando se supera el límite, la cuenta se cierra y se anula todo el profit acumulado. Los cuatro modelos con pérdidas habrían superado además el límite de drawdown total.
¿Se pueden copiar las operaciones de los modelos de IA?
Es una idea arriesgada. El resultado de un experimento corto no garantiza beneficios futuros: en la segunda temporada de Alpha Arena el líder cambió, y los estudios científicos no encuentran en los traders de IA una ventaja estable sobre el mercado. Los analistas de PANews también señalaron que en el éxito de los líderes hubo una parte de suerte: coincidieron con la subida general del mercado. Además, las operaciones con apalancamiento de hasta 25× son incompatibles con los límites de drawdown de la mayoría de los challenges de prop trading.
¿Qué IA opera mejor con criptomonedas?
No hay una respuesta definitiva. En la primera temporada de Alpha Arena, el mejor fue Qwen3 Max, pero 17 días es un plazo demasiado corto para sacar conclusiones. El estudio LiveTradeBench mostró que el puesto de un modelo en los rankings generales casi no tiene relación con sus resultados de trading, y Agent Market Arena, que la forma en que está construido el agente influye en el resultado más que el modelo elegido.
¿Se puede operar con IA en Upscale?
Sí. En Upscale puedes conectar tu propio bot por API, incluido uno escrito con ayuda de la IA; tienes los detalles en el artículo «Trading por API». Al trading automatizado se le aplican los mismos límites de drawdown que al manual. Y cuando un challenge se cierra, puedes solicitar el análisis con IA: estadísticas de las operaciones, tus tres errores principales y un plan de mejora.


