Des modèles d’IA puissants.
Directement dans votre navigateur.
Brimkern fait tourner des modèles open source directement sur votre carte graphique : sans installation, sans serveur tiers et sans abonnement. Les modèles arrivent en streaming, restent sur votre appareil et fonctionnent hors-ligne.
curl -fsSL https://brimkern.com/install.sh | bashmacOS & LinuxGuide CLIOu ouvrir dans le navigateur
$ brimkern run Qwen/Qwen2.5-0.5B-Instruct-GGUF
[gpu] WebGPU adapter: Apple M-series (resident KV cache)
[http] Streaming Q4_K_M weights (378 MB) via range requests
[wgsl] 14 custom shaders compiled · Zero server calls
✓ Model ready in 1.4s · 47.2 tok/s decodeChoisissez un modèle. Discutez immédiatement.
Architecture Liquid AI. Téléchargement instantané, empreinte mémoire minimale.
Alibaba. Excellent en raisonnement, code et dialogue en français.
Google Gemma 3. Modèle compact très efficace pour les requêtes courantes.
Trois raisons d’exécuter l’IA directement dans l’onglet
100 % Privé & hors-ligne
Vos conversations et documents ne quittent jamais votre machine. Aucun compte, aucun serveur et aucune collecte. Une fois chargé, le modèle continue de fonctionner même déconnecté d’Internet.
Zéro installation, zéro configuration
Pas de Python, pas de Docker, ni de pilotes complexes. Les modèles arrivent en quelques secondes via votre navigateur et restent en mémoire locale pour vos prochaines visites.
N’importe quel modèle open source
Exécutez les formats standards GGUF et BRIK depuis Hugging Face : Qwen, Gemma, Llama et bien d’autres. Discutez, résolvez des problèmes, décrivez des photos ou générez des images.
Du modèle à la réponse sur votre GPU
- 01Vous choisissez
author/modelUn modèle en un clic ou n’importe quel dépôt Hugging Face.
- 02On résout le meilleur fichier
L’API du Hub liste le dépôt et sélectionne la meilleure quantification pour votre appareil.
- 03Ça streame dans le cache local
Les couches se téléchargent en streaming et restent disponibles hors-ligne.
- 04Ça tourne sur votre GPU
Des compute shaders WebGPU calculent les réponses en direct sans aucun serveur.
Mesures réelles sur GPU
Une balise script, un assistant qui ne coûte rien à faire tourner
Le calcul, c’est le GPU de votre visiteur : aucune facture d’inférence, aucune limite de débit, aucune donnée qui quitte son navigateur. Le modèle ne se télécharge que si quelqu’un ouvre le widget : votre vitesse de page reste intacte.
Page SDK & démo live<script src="https://brimkern.com/sdk.js"></script>
<script>
Brimkern.embed({
system: "Tu réponds aux questions sur ma boutique.",
});
</script>Le même moteur, en assistant de code pour votre terminal
Il lit le projet dans lequel vous êtes et fait tourner Qwen 3 4B sur votre GPU. Rien ne quitte la machine.
Voir la CLIUn moteur, quatre modalités
- Chat : multi-tours, modèles à raisonnement, français & anglais, sur un cache KV résident en GPU.
- Vision : joignez une image et posez vos questions (Qwen2-VL, sur ordinateur).
- Images : texte vers image dans l’onglet (SD-Turbo / SDXS sur une pile de diffusion WebGPU).
- Vidéo (bêta) : de courts clips animés depuis un prompt, sur les mêmes kernels.