Modelos nuevos y en tendencia
LTX-2.5, el modelo de video de Lightricks con pesos abiertos, se ha consolidado esta semana como el más descargado de Hugging Face, con más de 1,6 millones de descargas. Sigue siendo el difusivo que genera y edita video con audio nativo en una sola pasada, y su Decodificador de Video por Difusión mantiene nítidos los rostros, el texto en pantalla y el movimiento rápido. El paquete incluye checkpoints GGUF para ejecución local. El acceso a los pesos es restringido por la licencia comunitaria LTX-2.x, que exige licencia comercial por encima de 10 millones de dólares de ingresos: conviene leerla antes de usarlo en producción.
La familia Qwen-Image-2.1 de la semana pasada sigue expandiéndose: Viggle publica un LoRA turbo destilado (Qwen-Image-2.1-viggle-turbo) que acelera la generación de imágenes en pocos pasos, pensado para pipelines locales en ComfyUI y Diffusers. La destilación en pocos pasos es lo que permite generar rápido en hardware modesto sin perder la calidad del modelo base. Tiene 460 likes y más de 200.000 descargas, y se integra directo sobre el checkpoint Qwen/Qwen-Image-2.1.
Edge0 publica Audio8-ASR-Infinite, un modelo de reconocimiento de voz (ASR) para streaming y tiempo real, en chino e inglés. Lo destaca su etiqueta 'infinite': está pensado para transcripciones largas y continuas, y acumula ya casi 2.000 likes y 26.000 descargas. Encaja con el día de audio que estamos teniendo —entre el panel de TTS de portada y los datasets de habla de la semana— y es un checkpoint interesante para montar dictado o transcripción en local.
La cuantización ternaria (2-bit) de Qwen3.8-27B de Prism ML, en GGUF, sigue rompiendo records con 3,6 millones de descargas. Un 27B que ocupa unos 5,9 GB frente a los ~54 GB del FP16, listo para llama.cpp en CUDA, Metal o CPU. Sigue siendo la referencia de cuantización extrema de la semana, con atención híbrida y comportamiento de razonamiento y agente conservado en régimen sub-4-bit.
Software y agentes
H Company ha lanzado Holo4, su familia de modelos 'generalista' para agentes de uso del ordenador (computer-use). Holo4-27B es un modelo de visión-lenguaje construido sobre Qwen3.8-27B que hace clic y teclea a través de interfaces gráficas, y se usa junto con el framework hai-agents. Es la respuesta más seria de la semana a los agentes de navegación, y el hecho de que apunte a un 27B de pesos abiertos lo hace interesante para quien quiere un agente de PC sin depender de una API cerrada. El blog de Hugging Face y la tarjeta del modelo tienen los detalles.
cmoraes10/loci es un proyecto nuevo de memoria a largo plazo con tipado para agentes de IA: un núcleo central, un servidor MCP y un plugin de Hermes. Es justo el tipo de pieza que falta para que los agentes autohospedados recuerden contexto entre sesiones, y lo mejor es que ya viene con integración para esta misma plataforma. Apenas lleva un día de vida, así que es una de las apuestas tempranas a seguir.
e2sy/jailbreak-archives es un archivo estructurado y versionado de técnicas de ingeniería de prompts adversarios contra LLMs, pensado para investigación de seguridad, red-teaming y refuerzo defensivo. Para quien monta modelos en local es el tipo de referencia que conviene tener a mano: documenta los vectores de ataque que existen y cómo blindarse. Open source y actualizado esta semana.
nanaism/yomiyasu es una Agent Skill en Python que elimina la 'pintura' de las frases generadas por IA y las reescribe en japonés natural. Tiene 607 estrellas y es una de las que más gana en GitHub hoy. Es un ejemplo curioso de cómo los 'skills' se están convirtiendo en unidades reutilizables de comportamiento para agentes, incluso en idiomas distintos del inglés.
Papers e investigación
UniEvo-VL es el paper más votado de la semana (51 upvotes en Hugging Face): una receta de autodistilación on-policy para que los modelos multimodales se automejoren. La idea es que el mismo sistema que genera también aprende de su propio feedback, uniendo generación y entendimiento en un marco autoevolutivo. Interesante como línea hacia modelos que se mejoran sin depender de datasets externos.
Mid-Harness (21 upvotes) propone escalar las acciones entre el modelo y el 'harness' de un agente de terminal. El problema es que una mala acción —instalar el paquete equivocado, por ejemplo— puede cambiar el entorno y estropear los pasos siguientes. El paper estudia cómo ejecutar de forma fiable las acciones que el modelo genera, un punto ciego de los agentes de línea de comandos.
AREX-2 (37 upvotes) avanza en agentes auto-mejorantes mediante tareas de reflexión de horizonte largo. Define la capacidad de refinar una solución en tiempo de ejecución, apoyada en dos pilares: la reflexión, que produce una evaluación de la propia respuesta, y la planificación. Es una de las líneas más activas de la semana en auto-mejora de agentes.
False Frontiers (8 upvotes) diagnostica y mitiga el 'co-cheating' en agentes de búsqueda autoevolutivos: cuando el que genera las preguntas y el que las resuelve se optimizan juntos, el bucle cerrado puede inflar resultados sin que haya aprendizaje real. Un aviso útil para quien entrena agentes con curriculum propio y quiere medir progreso genuino.
Comunidad y self-hosting
genrobot2025/Gen-HumanEgo es un dataset de escala masiva (la etiqueta indica más de 1 billón de unidades, licencia CC BY-SA 4.0) de IA encarnada: video egocéntrico, seguimiento de manos, trayectorias, SLAM y modelos VLA. Con más de 266.000 descargas, es el dataset de referencia de la semana para quien trabaja en robótica y percepción encarnada, y está disponible en Hugging Face.
espnet publica yodas3, un dataset de audio para ASR, TTS y traducción, con licencia CC BY 3.0 y más de 32.000 descargas. Encaja con el día de voz que estamos teniendo y es de los datasets de referencia del ecosistema espnet para entrenar modelos de habla.
El blog de Hugging Face documenta cómo el UK AISI y EvalEval están haciendo reproducibles los resultados de benchmarks: un paso importante para que las comparaciones entre modelos se puedan verificar, y no solo leer. Interesante como contrapeso a la proliferación de tablas de evaluación.
Jun Kim, creador y mantenedor de oMLX, se une a Hugging Face para apoyar a la comunidad MLX. MLX es el framework de inferencia de Apple para Mac, y la llegada de su figura principal refuerza el eje local/Mac dentro del ecosistema open.