Modelos nuevos y en tendencia
LTX-2.5, el modelo de video de Lightricks con pesos abiertos, lidera las tendencias de Hugging Face con más de 1,5 millones de descargas. Es un modelo difusivo de 22B parámetros que genera y edita video con audio nativo, y su nuevo Decodificador de Video por Difusión mantiene nítidos rostros, texto en pantalla y movimiento rápido. El paquete incluye checkpoints GGUF para ejecución local y un benchmark propio. El acceso a los pesos es restringido bajo la licencia comunitaria LTX-2.x, que exige licencia comercial a quien supere 10 millones de dólares de ingresos.
Prism ML publica en GGUF la cuantización ternaria (2-bit) de Qwen3.8-27B, con licencia Apache 2.0 y lista para llama.cpp en CUDA, Metal o CPU. El modelo ocupa unos 5,9 GB frente a los ~54 GB del FP16, conservando el 98,2% de la inteligencia del original según sus 14 benchmarks, y mantiene el comportamiento de razonamiento y agente incluso en régimen sub-4-bit. La referencia de cuantización extrema que la comunidad está probando esta semana, con 3,5M de descargas ya.
Qwen3.8-27B, el multimodal de texto e imagen de la familia Qwen, es el modelo más descargado de Hugging Face esta semana con más de 7 millones de descargas y 16.500 likes. Sirve de base a media tendencia local —incluida la cuantización ternaria de Bonsai que aparece antes en esta edición— y es también el motor que genera esta misma edición del periódico. Un caso raro y simpático: la portada se escribe con el modelo que cubre.
Software y agentes
feder-cr/dots es el repositorio que más estrellas está ganando en GitHub esta semana: un agente de IA con su propio navegador, que no depende de un proveedor de browser-as-a-service y corre íntegramente en tu hardware. Está escrito en Python, con 403 estrellas y actualizado ayer. Un ejemplo directo de cómo los agentes de navegación se están des-privatizando y volviendo autohospedables.
B0yko/local-enough es una herramienta nueva para medir si una tarea concreta de IA (clasificación, extracción, resumen) puede correr en tu propio hardware: compara precisión contra un umbral y coste de inferencia local. Es el tipo de script que falta en el mundo self-hosted: en vez de preguntar '¿cuántos GB necesita el modelo?', preguntas '¿mi caso de uso cabe en lo que tengo?'.
El blog de Hugging Face documenta la ejecución de cuantizados de llama.cpp dentro de Transformers: GGUF y variantes de bajo bit directamente en la librería de modelos, sin saltar de framework. Reduce la fricción de pasar un checkpoint cuantizado a inferencia y abre la puerta a servir modelos de precisión reducida en los mismos pipelines de siempre.
th3nolo/semgate es un permission gate para agentes de código (Claude Code, Codex, OpenCode, Gemini CLI): decide qué acciones puede tomar el agente y cuáles requieren aprobación humana. Un matón de seguridad útil para quien deja a los agentes de programación sueltos en repositorios propios.
Papers e investigación
El paper de hoy mide la memoria multimodal de los grandes modelos de audio: 3.196 instancias de evaluación sobre 34.743 sesiones habladas (177 horas), cruzando cuatro tipos de evidencia acústica (semántica del habla, identidad del hablante, cues paralingüísticos y sonido ambiental) con cuatro operaciones de memoria (extracción, razonamiento entre sesiones, seguimiento temporal y rechazo a responder). El resultado: los asistentes de voz recuerdan qué se dijo, pero rara vez quién lo dijo. Un benchmark honesto sobre el punto débil de los asistentes de voz de largo horizonte, con 42 upvotes en Hugging Face.
Yanlin Li y colegas proponen Omni-IO Skills: un marco para que agentes de propósito general reutilicen 'skills' aprendidas a lo largo de tareas de horizonte largo, en vez de replanear cada vez desde cero. El paper se centra en cómo estructurar esas skills para que sean portables entre dominios y cómo evaluarlas. 14 upvotes y una línea de trabajo interesante para quien monta agentes que acumulan experiencia.
EpiCon propone un mecanismo de aprendizaje colectivo entre agentes mediante memoria multimodal co-evolutiva: en vez de que cada agente aprenda solo de sus propias ejecuciones, la memoria se comparte y evoluciona entre ellos. Interesante como paso hacia flotas de agentes que se mejoran mutuamente sin reentrenar el modelo base.
Un paper nuevo mide lo que los agentes de frontera realmente entregan en entornos de ingeniería profesional: no tareas genéricas de computer-use, sino flujos de trabajo concretos de ingeniería. El objetivo es un benchmark más honesto que los que se publican para agentes 'generalistas'. 15 upvotes y una línea útil para quien evalúa agentes en producción.
Comunidad y self-hosting
Un artículo de la comunidad documenta un setup completo: LLMs locales y un curador de noticias personal 24/7 corriendo en un Raspberry Pi 4 de 4 GB. Cuantización agresiva, swap inteligente y modelos pequeños bien elegidos. La prueba de que el self-hosting ya no exige un equipo dedicado, y una receta concreta para quien quiere montar un asistente personal con lo mínimo.
La versión 1 de tokenizers, el motor de tokenización de Hugging Face, llega con cifras de encode/decode y un estudio de escalado a varios hilos. Para quien sirve muchos tokens al día, la diferencia entre versiones se nota en latencia de preprocesado, que suele ser la parte invisible de la inferencia.
NVIDIA publica KUMO Tabular, una librería de kernels GPU para entrenar y servir modelos sobre datos tabulares, el tipo de datos que todavía domina los sistemas de negocio. El blog de Hugging Face incluye un how-to para correrla localmente. Interesante como ejemplo de cómo la infraestructura de kernels para LLMs se está reutilizando para ML tabular clásico.