La prensa de la IA abiertaEdición en línea · 100% estática

ia·ahoy

IA Abierta Hoy — pesos abiertos, kernels, agentes y fine-tunes: lo que suena, lo que estrena y lo que empieza a importarte.

🎧 Si prefieres escuchar en lugar de leer…

La edición de hoy en audio. Dale al play: un resumen pensado para oírse, con la voz de la casa.

IA*A*Hoy en corto — solo está disponible la edición de hoy: el audio anterior no se conserva.

Modelos nuevos y en tendencia

LTX-2.5 de Lightricks: video con audio nativo y 1,5M de descargas

LTX-2.5, el modelo de video de Lightricks con pesos abiertos, lidera las tendencias de Hugging Face con más de 1,5 millones de descargas. Es un modelo difusivo de 22B parámetros que genera y edita video con audio nativo, y su nuevo Decodificador de Video por Difusión mantiene nítidos rostros, texto en pantalla y movimiento rápido. El paquete incluye checkpoints GGUF para ejecución local y un benchmark propio. El acceso a los pesos es restringido bajo la licencia comunitaria LTX-2.x, que exige licencia comercial a quien supere 10 millones de dólares de ingresos.

Hugging Face: Lightricks/LTX-2.5Paquete Diffusersvideodifusiónpesos abiertosLightricksGGUF

Bonsai 2 27B en ternario: un 27B que cabe en 5,9 GB

Prism ML publica en GGUF la cuantización ternaria (2-bit) de Qwen3.8-27B, con licencia Apache 2.0 y lista para llama.cpp en CUDA, Metal o CPU. El modelo ocupa unos 5,9 GB frente a los ~54 GB del FP16, conservando el 98,2% de la inteligencia del original según sus 14 benchmarks, y mantiene el comportamiento de razonamiento y agente incluso en régimen sub-4-bit. La referencia de cuantización extrema que la comunidad está probando esta semana, con 3,5M de descargas ya.

Qwen3.8-27B: 7M de descargas y el modelo de la semana

Qwen3.8-27B, el multimodal de texto e imagen de la familia Qwen, es el modelo más descargado de Hugging Face esta semana con más de 7 millones de descargas y 16.500 likes. Sirve de base a media tendencia local —incluida la cuantización ternaria de Bonsai que aparece antes en esta edición— y es también el motor que genera esta misma edición del periódico. Un caso raro y simpático: la portada se escribe con el modelo que cubre.

Hugging Face: Qwen/Qwen3.8-27BQwenmultimodaltrendingpesos abiertos

Software y agentes

dots: un agente de IA con su propio navegador, open source

feder-cr/dots es el repositorio que más estrellas está ganando en GitHub esta semana: un agente de IA con su propio navegador, que no depende de un proveedor de browser-as-a-service y corre íntegramente en tu hardware. Está escrito en Python, con 403 estrellas y actualizado ayer. Un ejemplo directo de cómo los agentes de navegación se están des-privatizando y volviendo autohospedables.

GitHub: feder-cr/dotsagentesself-hostingbrowseropen-source

local-enough: ¿cabe esta tarea de IA en tu hardware?

B0yko/local-enough es una herramienta nueva para medir si una tarea concreta de IA (clasificación, extracción, resumen) puede correr en tu propio hardware: compara precisión contra un umbral y coste de inferencia local. Es el tipo de script que falta en el mundo self-hosted: en vez de preguntar '¿cuántos GB necesita el modelo?', preguntas '¿mi caso de uso cabe en lo que tengo?'.

GitHub: B0yko/local-enoughself-hostingllamadahardware modestoGitHub

Transformers ya ejecuta cuantizados de llama.cpp

El blog de Hugging Face documenta la ejecución de cuantizados de llama.cpp dentro de Transformers: GGUF y variantes de bajo bit directamente en la librería de modelos, sin saltar de framework. Reduce la fricción de pasar un checkpoint cuantizado a inferencia y abre la puerta a servir modelos de precisión reducida en los mismos pipelines de siempre.

Blog: transformers-llama-cpp-quantsTransformerscuantizaciónGGUFlibrería

semgate: puerta de permisos para agentes de código

th3nolo/semgate es un permission gate para agentes de código (Claude Code, Codex, OpenCode, Gemini CLI): decide qué acciones puede tomar el agente y cuáles requieren aprobación humana. Un matón de seguridad útil para quien deja a los agentes de programación sueltos en repositorios propios.

GitHub: th3nolo/semgateagentesseguridadcódigoGitHub

Papers e investigación

VoxMem: ¿recuerda tu asistente de voz quién te dijo algo?

El paper de hoy mide la memoria multimodal de los grandes modelos de audio: 3.196 instancias de evaluación sobre 34.743 sesiones habladas (177 horas), cruzando cuatro tipos de evidencia acústica (semántica del habla, identidad del hablante, cues paralingüísticos y sonido ambiental) con cuatro operaciones de memoria (extracción, razonamiento entre sesiones, seguimiento temporal y rechazo a responder). El resultado: los asistentes de voz recuerdan qué se dijo, pero rara vez quién lo dijo. Un benchmark honesto sobre el punto débil de los asistentes de voz de largo horizonte, con 42 upvotes en Hugging Face.

arXiv 2609.32607Hugging Face PapersaudiomemoriabenchmarkLALM

Omni-IO Skills: agentes omni-nativos con skills reutilizables

Yanlin Li y colegas proponen Omni-IO Skills: un marco para que agentes de propósito general reutilicen 'skills' aprendidas a lo largo de tareas de horizonte largo, en vez de replanear cada vez desde cero. El paper se centra en cómo estructurar esas skills para que sean portables entre dominios y cómo evaluarlas. 14 upvotes y una línea de trabajo interesante para quien monta agentes que acumulan experiencia.

arXiv 2609.31847Hugging Face PapersagentesskillsaprendizajearXiv

EpiCon: agentes que aprenden de forma colectiva

EpiCon propone un mecanismo de aprendizaje colectivo entre agentes mediante memoria multimodal co-evolutiva: en vez de que cada agente aprenda solo de sus propias ejecuciones, la memoria se comparte y evoluciona entre ellos. Interesante como paso hacia flotas de agentes que se mejoran mutuamente sin reentrenar el modelo base.

arXiv 2609.37923Hugging Face PapersagentesmemoriamultimodalarXiv

EngiWorld: qué pueden hacer los agentes en entornos de ingeniería real

Un paper nuevo mide lo que los agentes de frontera realmente entregan en entornos de ingeniería profesional: no tareas genéricas de computer-use, sino flujos de trabajo concretos de ingeniería. El objetivo es un benchmark más honesto que los que se publican para agentes 'generalistas'. 15 upvotes y una línea útil para quien evalúa agentes en producción.

arXiv 2609.37686Hugging Face PapersagentesbenchmarkingenieríaarXiv

Comunidad y self-hosting

4 GB de RAM y un curador de noticias 24/7

Un artículo de la comunidad documenta un setup completo: LLMs locales y un curador de noticias personal 24/7 corriendo en un Raspberry Pi 4 de 4 GB. Cuantización agresiva, swap inteligente y modelos pequeños bien elegidos. La prueba de que el self-hosting ya no exige un equipo dedicado, y una receta concreta para quien quiere montar un asistente personal con lo mínimo.

Artículo (Medium)local-firstcuantizaciónhardware modestocomunidad

Tokenizers v1: encode, decode y escalado, medidos

La versión 1 de tokenizers, el motor de tokenización de Hugging Face, llega con cifras de encode/decode y un estudio de escalado a varios hilos. Para quien sirve muchos tokens al día, la diferencia entre versiones se nota en latencia de preprocesado, que suele ser la parte invisible de la inferencia.

Blog: tokenizers-v1tokenizersrendimientoHugging Face

NVIDIA KUMO: kernels GPU para ML tabular a escala

NVIDIA publica KUMO Tabular, una librería de kernels GPU para entrenar y servir modelos sobre datos tabulares, el tipo de datos que todavía domina los sistemas de negocio. El blog de Hugging Face incluye un how-to para correrla localmente. Interesante como ejemplo de cómo la infraestructura de kernels para LLMs se está reutilizando para ML tabular clásico.