Brimkern
WebGPU100 % on-device · Privé · Zéro appel serveur

Des modèles d’IA puissants.
Directement dans votre navigateur.

Brimkern fait tourner des modèles open source directement sur votre carte graphique : sans installation, sans serveur tiers et sans abonnement. Les modèles arrivent en streaming, restent sur votre appareil et fonctionnent hors-ligne.

curl -fsSL https://brimkern.com/install.sh | bash

macOS & LinuxGuide CLIOu ouvrir dans le navigateur

brimkern-engine.ts
WebGPU v0.9
# Fait tourner n’importe quel modèle Hugging Face sur votre GPU
$ brimkern run Qwen/Qwen2.5-0.5B-Instruct-GGUF
[gpu]  WebGPU adapter: Apple M-series (resident KV cache)
[http] Streaming Q4_K_M weights (378 MB) via range requests
[wgsl] 14 custom shaders compiled · Zero server calls
✓ Model ready in 1.4s · 47.2 tok/s decode
02 Architecture & Confidentialité

Trois raisons d’exécuter l’IA directement dans l’onglet

confidentialité totale

100 % Privé & hors-ligne

Vos conversations et documents ne quittent jamais votre machine. Aucun compte, aucun serveur et aucune collecte. Une fois chargé, le modèle continue de fonctionner même déconnecté d’Internet.

streaming instantané

Zéro installation, zéro configuration

Pas de Python, pas de Docker, ni de pilotes complexes. Les modèles arrivent en quelques secondes via votre navigateur et restent en mémoire locale pour vos prochaines visites.

écosystème ouvert

N’importe quel modèle open source

Exécutez les formats standards GGUF et BRIK depuis Hugging Face : Qwen, Gemma, Llama et bien d’autres. Discutez, résolvez des problèmes, décrivez des photos ou générez des images.

Ce que ça donne face à WebLLM (mesures réelles)

03 Pipeline & Shaders

Du modèle à la réponse sur votre GPU

  1. 01
    Vous choisissez author/model

    Un modèle en un clic ou n’importe quel dépôt Hugging Face.

  2. 02
    On résout le meilleur fichier

    L’API du Hub liste le dépôt et sélectionne la meilleure quantification pour votre appareil.

  3. 03
    Ça streame dans le cache local

    Les couches se téléchargent en streaming et restent disponibles hors-ligne.

  4. 04
    Ça tourne sur votre GPU

    Des compute shaders WebGPU calculent les réponses en direct sans aucun serveur.

04 Bancs d’essai matériels

Mesures réelles sur GPU

149 MB
plus petit modèle de chat, mis en cache une fois
47.2 tok/s
prefill sur un 7B int4 (WebLLM : 18,7)
15.8 s
pour recharger 4,7 Go depuis le cache
0
serveur, compte ou clé d’API requis
05 pour votre produit

Une balise script, un assistant qui ne coûte rien à faire tourner

Le calcul, c’est le GPU de votre visiteur : aucune facture d’inférence, aucune limite de débit, aucune donnée qui quitte son navigateur. Le modèle ne se télécharge que si quelqu’un ouvre le widget : votre vitesse de page reste intacte.

Page SDK & démo live
<script src="https://brimkern.com/sdk.js"></script>
<script>
  Brimkern.embed({
    system: "Tu réponds aux questions sur ma boutique.",
  });
</script>
06 aussi dans votre terminal

Le même moteur, en assistant de code pour votre terminal

Il lit le projet dans lequel vous êtes et fait tourner Qwen 3 4B sur votre GPU. Rien ne quitte la machine.

Voir la CLI
07 aussi dans la boîte

Un moteur, quatre modalités

  • Chat : multi-tours, modèles à raisonnement, français & anglais, sur un cache KV résident en GPU.
  • Vision : joignez une image et posez vos questions (Qwen2-VL, sur ordinateur).
  • Images : texte vers image dans l’onglet (SD-Turbo / SDXS sur une pile de diffusion WebGPU).
  • Vidéo (bêta) : de courts clips animés depuis un prompt, sur les mêmes kernels.