AI
-

Frontier Tuning: la trampa del mejor modelo del leaderboard
.
Frontier Tuning: la trampa del mejor modelo del leaderboard Ayer, mientras escribía esto, Kimi K3 se puso primero en el Frontend Code Arena, ganando por delante de Claude Fable 5 con un 76% de victorias por parejas. Los pesos abiertos…
-

Evaluación de agentes en Microsoft Foundry: la pirámide de EDD, en código
.
Hace unas unos días planteaba la pirámide de Evaluation-Driven Development: tests deterministas, trayectorias y tools, calidad semántica con LLM judges, evaluación humana, métricas de producción. Quedó claro el porqué. Lo que falta es el cómo, y resulta que Microsoft Foundry…
-

Harness Engineering: un agente potente sin harness es solo una demo con buena prensa
.
Harness Engineering: un agente potente sin harness es solo una demo con buena prensa Todos hemos visto el mismo vídeo de demo: un agente resuelve una tarea compleja en treinta segundos, la sala aplaude, y alguien publica un post diciendo…
-

Microsoft quiere que el vibe coding no muera al llegar a producción
.
Rayfin: Microsoft quiere que el vibe coding no muera al llegar a producción La IA ya puede montar un frontend de aplicación en segundos. El backend, los datos, la identidad, las políticas de acceso, sigue exigiendo coser a mano varios…
-

Foundry IQ + Content Understanding: el fin del RAG artesanal
.
La pelea con los RAGs artesanales, poco a poco, va llegando a su fin gracias a las automatizaciones, paquetes y evoluciones de la tecnología. Hoy, para quienes no lo sepan todavía, hablamos de Foundry IQ y Content Understanding, la nueva…
