IA al Día
Volver al archivo
Herramientas noticia 1 sept 2026 3 min de lectura

Hugging Face publica 207 kernels de WebGPU para acelerar la IA en el navegador

Hugging Face publicó 207 kernels de WebGPU como repositorios individuales con benchmark propio en el Hub, bajo Apache-2.0; la integración en Transformers.js todavía no llegó.

fuente primaria · huggingface.co — Introducing @huggingface/kernels: 200+ WebGPU Kernels for Local AI

Un modelo que corre en local dentro del navegador va tan rápido como las operaciones de GPU que dispara. El equipo WebAI de Hugging Face, Nico Martin y Joshua «Xenova», convirtió esa capa en un lanzamiento público y con benchmark propio el 1 de septiembre: @huggingface/kernels, un paquete de npm y una colección en el Hub de 207 kernels de WebGPU — las multiplicaciones de matrices, normalizaciones, operaciones de atención, cuantizaciones y convoluciones que un modelo necesita para correr sobre la GPU de un navegador.

Un repositorio del Hub por cada kernel

Cada kernel es su propio repositorio dentro de la organización webgpu-kernels del Hub, con un manifiesto que define el contrato de la operación, metadatos de procedencia, tests de corrección, benchmarks y plantillas de shader parametrizadas en .wgsl.jinja. Ahí está la apuesta: en vez de una sola implementación genérica incrustada en el runtime, cada operación queda como una pieza separada e inspeccionable que un runtime puede elegir según el dispositivo. Toda la colección tiene licencia Apache-2.0, y el paquete de npm se instala como preview, @huggingface/kernels@preview.

2,57x, en menos de la mitad de los casos probados

Hugging Face comparó sus kernels contra el backend de WebGPU de ONNX Runtime Web en una GPU Apple M4. De 1.756 casos de prueba repartidos en las 207 operaciones, sólo 809 dieron resultados coincidentes en ambos lados con tiempos fiables, y las cifras publicadas cubren únicamente ese subconjunto. En esos 809 casos, los kernels de Hugging Face ganaron 629, perdieron 176 y empataron 4, lo que da 2,57x de aceleración por media geométrica y 1,90x en la mediana. El resultado varía según la operación: Add llega a 3,52x, LayerNormalization a 2,22x, Softmax a 2,11x, y MatMul se queda en un 1,14x mucho más modesto. Hugging Face también advierte que el resultado cambia según la GPU, el navegador y el driver, y que en operaciones pequeñas el viaje de ida y vuelta a la GPU puede costar más que el cálculo mismo.

Todavía en preview, con Transformers.js por llegar

Los kernels aún no están conectados a Transformers.js, la librería de Hugging Face para inferencia en el navegador; esa integración está planeada, y el equipo dice estar trabajando también en subir mejoras al propio ONNX Runtime Web. Por ahora sólo hay cifras de una Apple M4; Hugging Face señala a Fleet, una herramienta de benchmarking colaborativo, para reunir resultados de otras GPU. Las cifras describen operaciones sueltas, no un modelo completo, así que cuánto se acelera en la práctica un modelo real en el navegador todavía no está medido. Para la inferencia local y privada —un modelo que corre entero en el navegador no manda nada a un servidor— Hugging Face todavía no publicó esa cifra de extremo a extremo.