Investigadores de Meta AI han desarrollado un marco innovador llamado EvoHarness-RL, que permite a modelos de inteligencia artificial más pequeños y asequibles alcanzar un rendimiento comparable al de modelos de vanguardia mucho más costosos, como Claude Opus 4.5. Este avance se centra en mejorar cómo los agentes de IA manejan tareas complejas y de largo alcance, donde la correcta gestión de la información y la toma de decisiones en tiempo real son cruciales.

El núcleo de EvoHarness-RL es una capa de abstracción que enseña a los modelos de IA cuándo y cómo utilizar sus herramientas y la información del entorno. A diferencia de los enfoques anteriores que dependían de instrucciones manuales y rígidas, este sistem a crea un espacio de trabajo unificado para el agente, conocido como BPE (Creencia, Progreso y Experiencia). Este espacio categoriza las necesidades del agente en tres áreas: 'Creencia' para entender el entorno actual, 'Progreso' para gestionar las subtareas completadas y pendientes, y 'Experiencia' para reutilizar conocimientos previos. El agente interactúa con este BPE mediante meta-acciones simples: rastrear, confirmar, recordar y anotar.
El entrenamiento de EvoHarness-RL se realiza en dos etapas. Primero, un ajuste fino supervisado enseña al modelo a extraer y estructurar datos útiles de los registros de interacción en el marco BPE. Luego, se utiliza aprendizaje por refuerzo sensible al costo para optimizar la eficiencia del agente, enseñándole a evaluar cuándo acceder a su estado externo vale la pena en términos de recursos computacionales. Este proceso transforma el uso de herramientas de un comportamiento codificado rígidamente a una habilidad aprendida en tie mpo de ejecución. En pruebas realizadas con el modelo Qwen3-8B, EvoHarness-RL logró una tasa de éxito del 96.9%, superando a otros métodos entrenables y equiparándose a modelos como Claude Opus 4.5 sin el elevado coste. Además, el marco BPE por sí solo demostró mejoras significativas en modelos grandes como GPT-4.1 y GPT-5, incluso sin la fase de aprendizaje por refuerzo. El proceso de entrenamiento también revela fenómenos como el "annealing del arnés", donde el agente reduce su dependencia de herramientas externas a medida que aprende patrones exitosos, y la "evolución del arnés", donde adapta dinámicamente su estrategia según la complejidad de la tarea. EvoHarness-RL se diseñó para integrarse fácilmente en sistemas existentes, ofreciendo un potencial considerable para optimizar las capacidades de los agentes de IA en entornos empresariales complejos sin necesidad de reemplazar la infraestructura actual.
Fuente Original: https://venturebeat.com/orchestration/meta-researchers-taught-an-8b-ai-model-to-match-claude-opus-4-5-without-the-frontier-price-tag
Artículos relacionados de LaRebelión:
- Salesforce CRM se integra en Claude Adios a las apps
- IA Descontrolada Agentes Claude se Sabotean y Ocultan Fallos
- Meta Lanza Nuevo Modelo de IA Abierta
- Modelo Astra de OpenAI Activa Pausa por Ciberamenazas
- Meta Lanza Muse Guerra de IA para Codificar
Artículo generado mediante LaRebelionBOT
No hay comentarios:
Publicar un comentario