Investigación autónoma con IA — ML agents que experimentan solos
🗓️ 2026-06-24✅ Explorado📦 Open Source🔥 30K+ Stars
630
líneas de código
700
experimentos en 2 días
1
GPU necesaria
30K+
GitHub stars
💡
¿Qué es?
autoresearch es un proyecto open source de Andrej Karpaty
(lanzado marzo 2026) que permite a agentes de IA correr experimentos de machine learning de forma
100% autónoma en una única GPU. Sin intervención humana, sin supervisión,
iterando las 24 horas.
Lo aplicó a mejorar nanochat — un modelo de lenguaje pequeño — entrenándolo automáticamente
y logrando 700 experimentos en solo 2 días.
🔄
Loop Autónomo
El agente modifica código, verifica métricas, y decide autónomamente qué cambios mantener.
🗝️
5 Claves de Diseño
1. Restricción clara
Espacio de búsqueda limitado. No "haz lo que quieras", sino iteración focalizada.
2. Métrica mecánica
Evaluación automática y objetiva: loss, AUC, win rate. Sin juicio humano.
3. Iteración autónoma
El agente decide qué probar, evalúa resultados, y itera sin parar.
4. Sin supervisión
Corre 24/7. Mantiene lo que funciona, descarta lo que no. Cero humano en el loop.
5. Simpleza radical
630 líneas, una GPU, sin infraestructura distribuida. Accesible para todos.
✨ Compounding Gains
Cada iteración se basa en las anteriores. Las mejoras son acumulativas.
🚀
¿Por qué es novedoso?
Demuestra autonomía REAL
No es un chatbot "sugiriendo" código. Es un agente ejecutando y evaluando.
Modifica código real, corre experimentos reales, y toma decisiones basadas en datos reales.
Pattern reutilizable
El loop modificar → verificar → mantener/descartar sirve para:
• Optimización de hiperparámetros
• Feature engineering automático
• Búsqueda de arquitecturas de modelos
• Fine-tuning autónomo
• ¿Investigación científica autónoma?
Accesible y reproducible
Una sola GPU, código abierto, sin servicios cloud caros. Cualquiera puede clonarlo y empezar.
No necesitas infraestructura distribuida ni presupuesto empresarial.
Ganancias acumulativas
Cada iteración se basa en todas las anteriores. No empieza de cero. Después de 700 experimentos,
el modelo ha mejorado de forma significativa porque solo retiene lo que funciona.