~/your-project $ brimkern chat
Votre assistant de code tourne sur votre GPU, dans votre terminal.
Qwen 3 4B sur des kernels WGSL écrits à la main. Ni serveur, ni clé d’API, ni compte : votre code ne quitte jamais la machine.
curl -fsSL https://brimkern.com/install.sh | bash01 · une vraie session
Il répond au fil de l’eau, à la vitesse que vous aurez.
Une capture du terminal, pas une maquette. Le Markdown est rendu pendant le flux : gras, code, listes.
02 · votre projet
Posez une question sur votre dépôt. Il a lu le README.
Lancé dans un dossier, Brimkern donne au modèle le README, la description du paquet et la branche git. Mentionnez un fichier avec @path/file.ts pour l’ajouter, ou lancez /diff pour relire vos modifications.
kern › what is this project for? answer in two sentences This project aims to provide a local, GPU-accelerated AI model running environment without requiring an API key or server setup. It allows users to stream and run Hugging Face models directly in their browser using WebGPU and other technologies, with all processing done locally on the user's device. ⏱ 8.45s · ~7.1 tok/s · 60 tokens · ≈ $0.0017 saved (session: $0.0017) (Dawn (Metal))
┌─ Brimkern session status ──────────────────────────────────────────────────┐ │ Active model : Qwen 3 4B (BRIK int4) │ │ Engine & GPU : Native Dawn (in-process) · Dawn (Metal) │ │ AI mode : [CODE] Direct code generation, exact syntax, concise │ │ Reasoning : auto (Detects and formats <think>...</think> blocks) │ │ Git repo : main (modified *) │ │ Inference : 100% local · 60 tokens · ~7.1 tok/s (8.4s) · ≈ $0.0017 │ │ saved │ └────────────────────────────────────────────────────────────────────────────┘
03 · modèles
Changez de modèle en cours de session, ou amenez-en un de Hugging Face.
| preset | modèle | vitesse | pour |
|---|---|---|---|
| coder | Qwen 3 4B BRIK int4 · 2,53 Go | 13–16 tok/s | le défaut, le plus juste |
| fast | Qwen 2.5 Coder 1.5B GGUF Q4_K_M · 1,12 Go | ~25 tok/s | questions rapides, plus léger |
Ou n’importe quel GGUF mono-fichier de Hugging Face, la meilleure quantification choisie pour vous : --model=Qwen/Qwen3-0.6B-GGUF
┌─ Brimkern · On-device model selector ────────────────────────────────────────┐ Use ↑/↓ to scroll · Enter to activate · Esc to cancel ┄ coder Qwen 3 4B [BRIK int4 ] 2.53 GB ● active ❯ fast Qwen 2.5 Coder 1.5B [GGUF Q4_K_M] 1.12 GB ┄ ┌─ Spec sheet: Qwen 2.5 Coder 1.5B ────────────────────────────────────────────┐ │ Architecture: Qwen 2.5 Coder 1.5B · Size: 1.12 GB · [Fast] │ │ Twice as fast (~25 tok/s) and lighter; review the code it suggests, it makes │ │ more mistakes. │ │ Format: GGUF Q4_K_M · Engine: WebGPU (Chromium) │ │ Command: /model fast │ └──────────────────────────────────────────────────────────────────────────────┘
04 · local
Rien ne quitte la machine.
Le dernier chiffre est une estimation, présentée comme telle : ce qu’une API payante aurait facturé pour la même conversation (tokens ≈ caractères / 4, historique compté à chaque tour, 3 $ / 15 $ par million de tokens en entrée / sortie ; BRIMKERN_PRICE_IN et BRIMKERN_PRICE_OUT pour mettre le vôtre).