Share-Electric.cz
Údržba

Introducing @huggingface/kernels: 200+ WebGPU Kernels for Local AI

Introducing @huggingface/kernels: 200+ WebGPU Kernels for Local AI - Údržba | SmartEnergyShare

200+ kernelů WebGPU zdarma: Hugging Face dělá lokální AI realitou. Bez serveru, bez API klíče, bez předplatného

Flash Attention ve vašem prohlížeči. Bez serveru, bez API klíče, bez tarifu za token. Knihovna @huggingface/kernels přináší přes dvě stě optimalizovaných GPU kernelů, které poběží na vašem hardwaru — dokonce na tom integrovaném grafickém čipu, který dosahu jen přehrával YouTube. Hugging Face to oznámil jako rozšíření ekosystému transformers.js a tiše mění pravidla hry. Lokální inference už není záležitost Cracka s nainstalovaným Ollamou. Je to záležitost webové stránky.

Co se vlastně stalo

Tyding Face vypustil balíček @huggingface/kernels — JavaScriptovou knihovnu obsahující dvě stovky a více WebGPU kernelů. Kernel je v tomto kontextu malá, agresivně optimalizovaná GPU funkce: násobení matic, RMSNorm, RoPE, kvantované operace, pozornost. Věci, na kterých stojí každý transformer, od SmolLM po Llamu.

Proč je to průlom? Dosud jste pro lokální AI potřebovali desktopovou aplikaci — Ollama, LM Studio, llama.cpp. Webové modely běžely přes ONNX Runtime Web, ale bez pořádných kernelů to bylo pomalé. WebGPU kernelů z minulosti bylo pár, psaných ručně, špatně verzovaných. Nová knihovna přichází s registrem: kernely se stahují na vyžádání z CDN Hugging Face, mají správu verzí a ladí k konkrétnímu modelu. Stáhnete si jen to, co použijete. Žádný gigabajt balíčku, kde devadesát procent kódu nikdy nespustíte.

Praktický dopad? Model jako Qwen2.5-0.5B v kvantizaci Q4 se načte a odpovídá v prohlížeči s latencí kolem několika desítek milisekund na token na běžném notebooku. Bez instalace čehokoli. Uživatel klikne na odkaz a má AI.

Jak to funguje pod kapotou

WebGPU je nástupce WebGL, který konečně dává webovým vývojářům přístup ke compute shaderům. Zatímco WebGL uměl kreslit trojúhelníky, WebGPU umí spouštět obecné výpočty na GPU — přesně to, co potřebovala inference. Zápis probíhá ve WGSL, shaderovém jazyku podobném Rustu.

Kernely z @huggingface/kernels nejsou žádný wrapper nad CPU. Jde o ručně psané WGSL shadery optimalizované pro reálné čipy. Například operace matmul pro kvantizované váhy (Q4, Q8) zvládne číst komprimovaná data přímo z paměti GPU a dekvantovat za běhu. Attention kernely podobné Flash Attention šetří paměťovou šířku pásma tím, že nepromítají celé matice pozornosti do paměti, ale počítají po blokách.

Knihovna se chová jako správce balíčků pro GPU kód. Zadejte jméno kernelu, konkrétní verzi a konfiguraci — knihovna stáhne předkompilovaný modul, nebo shader zkompiluje přímo v prohlížeči. Pokud WebGPU chybí (Firefox, starší Safari), fallback jde na WASM s multi-threadingem. Pomalejší, ale funkční. To je důležité pro produkci — nechcete, aby půlka návštěvníků viděla bílou obrazovku.

Chcete ušetřit na energiích?

Zjistěte, kolik můžete ušetřit sdílením elektřiny z FVE nebo optimalizací bateriového úložiště.

Spočítat úsporu →

Návod: první model v prohlížeči za deset minut

Dost teorie. Instalace je jedna řádka:

```bash npm install @huggingface/transformers ```

A kód pro spuštění modelu:

```javascript import { pipeline } from '@huggingface/transformers';

const generator = await pipeline( 'text-generation', 'onnx-community/Qwen2.5-0.5B-Instruct', { device: 'webgpu', dtype: 'q4f16' } );

const output = await generator( 'Vysvětli mi sdílení elektřiny jednou větou.', { max_new_tokens: 100 } ); ```

Trik je v parametru `device: 'webgpu'` — to přepne výpočet z CPU na GPU a kernely se načtou automaticky. `dtype: 'q4f16'` říká, že chcete 4bitovou kvantizaci s FP16 aktivacemi. Model se při prvním spuštění stáhne (pro 0.5B parametrů zhruba 400 MB) a uloží do Cache API prohlížeče. Druhá návštěva stránky je okamžitá.

Co běží dobře: SmolLM2, Qwen2.5, Phi-3.5-mini, Whisper pro přepis řeči, embedding modely pro sémantické vyhledávání. Pro seriózní práci s výstupy existují i menší modely laděné pro strukturovaný výstup — hora nabídek najdete na Hugging Face Hubu, stačí filtrovat podle ONNX formátu.

Který hardware to utáhne a kolik to stojí

Tady to bude konkrétní. Testoval jsem (a komunita potvrdila) následující orientaci:

  • Integrované GPU (AMD Radeon 780M, Intel Iris Xe): modely do 1–3 miliard parametrů v Q4 plynule. Notebook za 25 000 Kč stačí.
  • Discretní GPU (RTX 3060, 12 GB VRAM): pohodlně 7–8 miliard parametrů v Q4. Kolem 4–5 GB paměti na model.
  • Apple Silicon (M1–M4): WebGPU přes Metal backend, 3B model běží na základním MacBooku Air.
  • Mobil: Pixel 8 a novější, iPhone 15 Pro — menší modely a Whisper Tiny, spíš demo než produktivní nasazení.

Cena? Nula korun za software. Prouďte ale nezapomínejte: dedikovaná GPU při zátěží táhne 200–250 W. Při české ceně kolem 3 Kč/kWh včetně distribuce vyjde hodina nepřetržitého běhu na zhruba 0,70 Kč. To je o řád méně než API výzvy u komerčních poskytovatelů při intenzivním používání. A teď ta zajímavá myšlenka: pokud máte fotovoltaiku, můžete inferenci plánovat na přebytky výroby. Aktuální spotové ceny elektřiny ukazují, kdy je energie nejlevnější — a domácí GPU farma to umí využít. Podobně IoT monitoring spotřeby vám řekne, kolik vám inferencia reálně přidá na faktuře.

Údržba bez serveru: výhoda, kterou podceňujete

Kategorie údržba tu není náhodou. Lokální AI v prohlížeči radikálně snižuje provozní zátěž. Nemáte inference server, který je potřeba patchovat po každém bezpečnostním upozornění. Nemáte GPU clustery, kde sledujete teploty a utiliy. Prohlížeč se aktualizuje sám a WebGPU rozhraní je stabilní standard pod W3C.

Verzování kernelů je na straně Hugging Face — knihovna tahá přesně určené verze, takže váš build je reprodukovatelný. Žádné „u mě to běželo, protože jsem měl jinou verzi CUDA". To znáte.

Zůstává ale jedna paseka: evikce cache. Prohlížeč může při tlaku na úložiště smazat stažené modely — zvlášť na mobilu. Řešením je Service Worker s vlastní správou cache nebo konverze uživatele k instalaci jako PWA. A pozor na soukromí v druhém smyslu: lokální modely také znamenají, že kdokoli si v prohlížeči spustí i modely bez Content Fence. Neexistuje žádná centrální brzda. Je to objektivní vlastnost architektury, ne bug. Se vším, co z toho plyne.

Úskalí: co vám demo na YouTube neřekne

Nejdřív paměť. Chrome na Windows má limit paměti na tab, kolem 4 GB. Model 7B v Q4 se tam vešel těsně a často se udusí. Firefox stále WebGPU finální nemá — spadnete na pomalý WASM fallback. Safari podporuje jen část standardu. Testujte na cílových prohlížečích, ne jen na svém.

Za druhé: první načtení bolí. Stahujete stovky megabajtů až gigabajty. Uživatel na mobilním datu vám odejde dřív, než proběhne progress bar. Řešením jsou menší modely (0.5B–1B) a upřímná komunikace: „První spuštění trvá minutu, pak je to okamžité."

Za třetí: debugování. Když WGSL kernel vyprodukuje NaN, dostanete černou obrazovku a pocit beznaděje. Nástroje pro ladění GPU kódu jsou ve srovnání s CPU stále kamenná doba. A konečně podpora modelů — transformátory s nestandardní architekturou mohou kernely nemat. Vždy mějte fallback plán: serverová inference pro staré prohlížeče, lokální pro moderní. Hybridní přístup je dnes rozumná norma.

Kam to směřuje

Má předpověď: do dvou let bude lokální inference v prohlížeči standardní součástí webových aplikací. Autodokončování ve formulářích, sémantické vyhledávání v dokumentech, přepis hovorů — to všechno poběží na klientském GPU a provozovatel za to nebude platit tokeny. Kolem云 potrvá pro těžké úlohy, ale 80 % každodenních AI úkonů se přesune na hranu.

Pro energetiku je to zajímavá šipka — AI analýzy spotřeby a výroby mohou běžet přímo v ovládací aplikaci domácnosti, bez posílání dat o životě do cloudu. Jak přesně funguje taková lokální smart grid logika, rozebírá SmartEnergyShare.info v kontextu AI v energetice. A pokud uvažujete o sdílení přebytků z FVE a využití je pro plánování spotřeby, podívejte se na ShareElectric.cz — přebytek z panelů je ideální „palivo" pro domácí výpočty.

Vyzkoušejte to dnes. Otevřete terminal, napište `npm install`, a za deset minut budete mít vlastní AI, na kterou se nedotkne ani výpadek cloudu, ani zdražení API. packages Těžko říct, jestli to zachrání svět. Ale vaši fakturu za AI služby může šetřit už teď.

Zdroje

Chcete sdílet elektřinu, optimalizovat náklady nebo začít s obchodováním energie? SmartEnergyShare je platforma pro sdílení energie z FVE, správu bateriových úložišť a chytré řízení spotřeby. Registrace zdarma →

Další články na toto téma najdete na: SmartEnergyShare.info vLLM V1: Tichá revoluce, která zachránila trénink AI mode... Vice o emo: pretraining