N’importe quel modèle du Hub.
Exécuté dans votre navigateur.
Brimkern lit les GGUF mono-fichier directement depuis Hugging Face et les exécute sur votre propre GPU — sans conversion, sans étape de compilation, sans serveur, sans clé d’API. Les poids arrivent une fois, restent chez vous, et fonctionnent hors-ligne ensuite.
Chrome, Edge, ou Safari 18+. Gratuit, open source (MIT), sans compte.

Trois choses qu’on ne trouve pas ensemble ailleurs
Le format que le Hub héberge déjà
Collez auteur/modèle et ça tourne. La meilleure quantification est choisie pour vous, le tokenizer vient du fichier. Les autres moteurs navigateur exigent des poids pré-compilés dans leur propre format avant de pouvoir y toucher.
WGSL, validé au chargement
Le forward pass est fait de compute shaders écrits à la main — matmuls quantifiés fusionnés, cache KV résident, une seule bibliothèque de kernels pour le texte, la vision, l’image et la vidéo. Chacun se valide contre une référence CPU au chargement, et retombe sur un chemin plus simple si un GPU compile mal.
.brik : une couche = une plage HTTP
Notre conteneur range les poids déjà quantifiés dans la disposition exacte que lisent les kernels, une couche par plage contiguë. Un modèle de 4,7 Go revient du cache en 15,8 s — reprise possible, partielle, vraiment hors-ligne ensuite.
D’un nom de dépôt à des tokens sur votre GPU
- 01Vous collez
author/modelUn identifiant, une URL du Hub, ou un lien direct.
- 02On résout le meilleur fichier
L’API du Hub liste le dépôt ; la meilleure quantification gagne (un .brik devant un GGUF).
- 03Ça streame une couche = une plage
Seulement les octets de la couche en cours, reprise possible, gardés sur votre appareil.
- 04Ça tourne sur votre GPU
Des kernels WGSL écrits à la main. Rien ne repart — il n’y a aucun serveur où l’envoyer.
Une balise script, un assistant qui ne coûte rien à faire tourner
Le calcul, c’est le GPU de votre visiteur : aucune facture d’inférence, aucune limite de débit, aucune donnée qui quitte son navigateur. Le modèle ne se télécharge que si quelqu’un ouvre le widget : votre vitesse de page reste intacte.
Page SDK & démo live<script src="https://brimkern.com/sdk.js"></script>
<script>
Brimkern.embed({
system: "Tu réponds aux questions sur ma boutique.",
});
</script>Un moteur, quatre modalités
- Chat — multi-tours, modèles à raisonnement, français & anglais, sur un cache KV résident en GPU.
- Vision — joignez une image et posez vos questions (Qwen2-VL, sur ordinateur).
- Images — texte vers image dans l’onglet (SD-Turbo / SDXS sur une pile de diffusion WebGPU).
- Vidéo (bêta) — de courts clips animés depuis un prompt, sur les mêmes kernels.