Hugging Face släpper 207 GPU-kärnor för lokal AI i webbläsaren
Ett nytt öppet bibliotek paketerar de små GPU-operationerna bakom lokal AI – och testar dem på riktiga webbläsare.
Hugging Face släpper 207 färdiga WebGPU-kärnor för AI som körs lokalt i webbläsaren. Det är de små GPU-operationerna under en modell – som matrismultiplikation, normalisering och attention – som nu paketeras för att kunna laddas, testas och bytas utan att hela AI-motorn byggs om.
Biblioteket heter @huggingface/kernels och hämtar kärnorna från Hugging Face Hub. Enligt lanseringen får varje kärna ett versionsstyrt paket med gränssnitt, shadermallar, testfall, benchmark och instruktioner. Samlingen är licensierad under Apache 2.0 och täcker 207 operationer.
Det spelar roll eftersom WebGPU i sig bara gör grafikkortet tillgängligt i webbläsaren. Hastigheten avgörs fortfarande av hur varje operation är skriven för den aktuella kombinationen av GPU, webbläsare, datatyp och indatastorlek. Hugging Faces upplägg gör de lägsta byggblocken sökbara och utbytbara, medan applikationen kan behålla samma JavaScript-anrop.

Hugging Face redovisar också ett första hastighetstest mot ONNX Runtime Web på en Apple M4-GPU. Av 1 756 testfall behölls 809 där båda systemen gav samma resultat och stabila tider. I den gruppen var de nya kärnorna 2,57 gånger snabbare i geometriskt medel och 1,90 gånger snabbare i median. De vann 629 jämförelser, förlorade 176 och fick fyra oavgjorda.
Det är lovande, men inte samma sak som att en komplett modell blir dubbelt så snabb. Mätningen omfattar bara själva GPU-arbetet och räknar bort laddning, kompilering, dataöverföring och avläsning. Resultatet kommer dessutom från en enda maskin. Hugging Face betonar själv att prestandan varierar mellan grafikkort, drivrutiner och webbläsare.
Därför lanseras även Fleet, ett benchmarkverktyg som kör testerna direkt på användarens hårdvara. Med samtycke kan varje körning bidra med resultat som avslöjar fel och långsamma specialfall. Tanken är att välja bättre kärnvarianter utifrån verkliga enheter i stället för ett enda testlabb.
Hugging Face har publicerat 207 versionsstyrda WebGPU-kärnor och ett JavaScript-bibliotek som kör dem lokalt i webbläsaren. Samtidigt öppnas Fleet för distribuerade prestanda- och korrekthetstester på olika GPU:er.
Lokal AI i webbläsaren begränsas ofta av de mest grundläggande GPU-operationerna. Gemensamma, testbara kärnor kan göra det lättare för flera AI-ramverk att bli snabbare utan att varje projekt behöver optimera samma operation från början.
Det här är infrastruktur snarare än en ny modell, men just därför kan effekten bli bred. Det avgörande blir inte toppresultatet på en M4, utan om Fleet visar stabila vinster över många enheter och om högre modellramverk faktiskt börjar använda kärnorna. Då kan webbläsaren ta ett tydligare steg från AI-demo till praktisk lokal körtid.




