Modèles & format .brik
Ce que le moteur charge et comment : les GGUF mono-fichier directement depuis Hugging Face, architectures supportées, kernels de quantification, liens de test partageables, et format streamé .brik avec son convertisseur intégré.
N'importe quel modèle Hugging Face
Brimkern lit directement les modèles GGUF mono-fichier : le format standard hébergé sur Hugging Face, sans étape de conversion ni compilation serveur. Collez n'importe laquelle de ces formes dans le champ d'accueil, le navigateur de modèles ou la CLI :
Qwen/Qwen2.5-Coder-1.5B-Instruct-GGUF https://huggingface.co/bartowski/DeepSeek-R1-Distill-Qwen-1.5B-GGUF https://huggingface.co/unsloth/gemma-3-270m-it-GGUF/blob/main/gemma-3-270m-it-Q4_K_M.gguf https://example.com/my-custom-model.gguf
Le moteur résout le dépôt via l'API Hugging Face, inspecte les fichiers disponibles et sélectionne automatiquement la meilleure quantification (priorité au format .brik streamé, puis Q4_K_M, Q4_K_S, Q4_0, Q4_1, Q5_K, Q3_K, Q8_0). Le tokenizer, le vocabulaire, la base RoPE et les hyperparamètres sont lus directement dans l'en-tête GGUF.
Architectures supportées
Brimkern intègre des kernels WGSL natifs écrits à la main pour chaque grande famille de modèles :
Qwen 2, Qwen 2.5, Qwen 2.5 Coder, Qwen 3 (réflexion <think>), et Qwen 3.5 SSM (hybride DeltaNet conv causale + état récurrent).
Llama 2, Llama 3, Llama 3.1, Llama 3.2, Granite 4.0 Micro et Falcon 3. Appariement RoPE entrelacé (ggml NORM) géré nativement.
DeepSeek-R1 Distill (sur base Qwen et Llama) de 1.5B à 7B avec décodage du monologue interne.
Gemma 1, Gemma 2 (softcaps tanh 50/30, gate GELU, échelle de pré-attention), et Gemma 3 (attention alternée 5 locales / 1 globale fenêtrée).
Mistral 7B et Ministral 3 avec transform statique YaRN et mise à l’échelle d’attention.
SmolLM, SmolLM2 et SmolLM3 avec architecture NoPE (1 couche sur 4 sans RoPE pour contextes longs).
Liquid AI LFM2/2.5 (conv courte gatée + attention) et BlinkDL RWKV-7 (état résident fixe ~1 Mo remplaçant le cache KV).
Quantifications & kernels WebGPU
Brimkern exécute la déquantification des poids directement sur le GPU via des compute shaders WebGPU. Chaque kernel est testé contre une référence CPU au démarrage (selfValidate) avec repli transparent et kill-switch URL.
Quantifications GGML / GGUF supportées :
| Quantification | Format de bloc | Kernel GPU | Usage typique |
|---|---|---|---|
| Q4_K_M / Q4_K_S | 256 weights, 144 B | dequant_q4k | Choix recommandé par défaut pour modèles 1B-4B |
| Q3_K (M, S, L) | 256 weights, 110 B | dequant_q3k | Fait tenir les modèles 7B-8B sous ~3,8 Go de VRAM sur machines 8 Go |
| Q4_0 | 32 weights, 18 B | dequant_q4_0 | Quantification 4 bits symétrique standard |
| Q4_1 | 32 weights, 20 B | dequant_q4_1 | Quantification 4 bits asymétrique avec offset min |
| Q5_0 / Q5_K | 32 / 256 weights | dequant_q5_0 / dequant_q5k | Plus haute précision sur les projections critiques |
| Q6_K | 256 weights, 210 B | dequant_q6k | Couches haute fidélité dans les GGUF mixtes |
| Q8_0 | 32 weights, 34 B | dequant_q8_0 | Précision entière 8 bits, tête de sortie quasi sans perte |
| F16 / F32 | 1 weight | direct native | Tenseurs non quantifiés (poids RMSNorm, biais) |
Limites & exclusions
Pour préserver la stabilité du navigateur et la mémoire de l’onglet, certains formats sont explicitement refusés avec un message explicatif :
- GGUF shardés : Les fichiers découpés en plusieurs morceaux (-00001-of-00005) ne sont pas acceptés. Brimkern streame par plages HTTP contiguës sur un fichier unique. Choisissez la version mono-fichier.
- Projecteurs mmproj seuls : Les fichiers nommés mmproj-* contiennent les projecteurs de vision et ne peuvent pas tourner seuls sans modèle de langue.
- Quantifications IQ à table de codes : Les formats IQ1, IQ2, IQ3_XXS, IQ4_XS utilisent des tables de codes non adaptées au calcul vectoriel direct en WGSL. Privilégiez Q3_K, Q4_K_M ou Q4_0.
- Limites de mémoire (VRAM) : Les modèles jusqu’à 1.5B (~1,2 Go) tournent facilement sur mobile et laptop. Les modèles 3B à 4B (~2-2,6 Go) demandent 8 Go+ de RAM. Les modèles 7B (~4-5 Go) nécessitent 16 Go+ de RAM.
Liens de test instantané
N'importe quel modèle peut devenir un lien qui le charge directement : pratique pour partager une démo, joindre un rapport de bug, ou renvoyer un collègue vers une quantification précise.
https://brimkern.com/chat?model=Qwen/Qwen3-0.6B-GGUF https://brimkern.com/chat?model=Qwen/Qwen3-0.6B-GGUF&file=Qwen3-0.6B-Q8_0.gguf https://brimkern.com/chat?gguf=https://example.com/model.gguf https://brimkern.com/chat?brik=https://example.com/model.brik
?model= interroge l'API du Hub et choisit le meilleur fichier chargeable (un .brik gagne sur un GGUF). ?file= force une quantification précise. ?gguf= et ?brik= prennent une URL directe, pour les modèles que vous hébergez vous-même.
Le format .brik & le convertisseur
Un .brik est un GGUF ré-empaqueté pour le navigateur : poids déjà quantifiés en int4/int8, disposés pour qu'une couche soit une seule plage HTTP contiguë, tokenizer embarqué. Effet concret : le modèle se charge par plages (reprise possible, partiellement, vraiment hors-ligne ensuite) au lieu d'un téléchargement de plusieurs gigaoctets.
Vous pouvez convertir un GGUF vous-même, dans le navigateur. Le fichier ne quitte jamais votre machine : ouvrir le convertisseur.
Brimkern : moteur WebGPU open, conçu par Romain Khanoyan. IA locale, WebGPU, moteurs on-device.