Brimkerndocs

Modèles & format .brik

Ce que le moteur charge et comment : les GGUF mono-fichier directement depuis Hugging Face, architectures supportées, kernels de quantification, liens de test partageables, et format streamé .brik avec son convertisseur intégré.

N'importe quel modèle Hugging Face

Brimkern lit directement les modèles GGUF mono-fichier : le format standard hébergé sur Hugging Face, sans étape de conversion ni compilation serveur. Collez n'importe laquelle de ces formes dans le champ d'accueil, le navigateur de modèles ou la CLI :

Qwen/Qwen2.5-Coder-1.5B-Instruct-GGUF
https://huggingface.co/bartowski/DeepSeek-R1-Distill-Qwen-1.5B-GGUF
https://huggingface.co/unsloth/gemma-3-270m-it-GGUF/blob/main/gemma-3-270m-it-Q4_K_M.gguf
https://example.com/my-custom-model.gguf

Le moteur résout le dépôt via l'API Hugging Face, inspecte les fichiers disponibles et sélectionne automatiquement la meilleure quantification (priorité au format .brik streamé, puis Q4_K_M, Q4_K_S, Q4_0, Q4_1, Q5_K, Q3_K, Q8_0). Le tokenizer, le vocabulaire, la base RoPE et les hyperparamètres sont lus directement dans l'en-tête GGUF.

Architectures supportées

Brimkern intègre des kernels WGSL natifs écrits à la main pour chaque grande famille de modèles :

Qwen (Alibaba)

Qwen 2, Qwen 2.5, Qwen 2.5 Coder, Qwen 3 (réflexion <think>), et Qwen 3.5 SSM (hybride DeltaNet conv causale + état récurrent).

Llama (Meta)

Llama 2, Llama 3, Llama 3.1, Llama 3.2, Granite 4.0 Micro et Falcon 3. Appariement RoPE entrelacé (ggml NORM) géré nativement.

DeepSeek (DeepSeek AI)

DeepSeek-R1 Distill (sur base Qwen et Llama) de 1.5B à 7B avec décodage du monologue interne.

Gemma (Google)

Gemma 1, Gemma 2 (softcaps tanh 50/30, gate GELU, échelle de pré-attention), et Gemma 3 (attention alternée 5 locales / 1 globale fenêtrée).

Mistral (Mistral AI)

Mistral 7B et Ministral 3 avec transform statique YaRN et mise à l’échelle d’attention.

SmolLM (Hugging Face)

SmolLM, SmolLM2 et SmolLM3 avec architecture NoPE (1 couche sur 4 sans RoPE pour contextes longs).

Hybrides & Récurrents

Liquid AI LFM2/2.5 (conv courte gatée + attention) et BlinkDL RWKV-7 (état résident fixe ~1 Mo remplaçant le cache KV).

Quantifications & kernels WebGPU

Brimkern exécute la déquantification des poids directement sur le GPU via des compute shaders WebGPU. Chaque kernel est testé contre une référence CPU au démarrage (selfValidate) avec repli transparent et kill-switch URL.

Quantifications GGML / GGUF supportées :

QuantificationFormat de blocKernel GPUUsage typique
Q4_K_M / Q4_K_S256 weights, 144 Bdequant_q4kChoix recommandé par défaut pour modèles 1B-4B
Q3_K (M, S, L)256 weights, 110 Bdequant_q3kFait tenir les modèles 7B-8B sous ~3,8 Go de VRAM sur machines 8 Go
Q4_032 weights, 18 Bdequant_q4_0Quantification 4 bits symétrique standard
Q4_132 weights, 20 Bdequant_q4_1Quantification 4 bits asymétrique avec offset min
Q5_0 / Q5_K32 / 256 weightsdequant_q5_0 / dequant_q5kPlus haute précision sur les projections critiques
Q6_K256 weights, 210 Bdequant_q6kCouches haute fidélité dans les GGUF mixtes
Q8_032 weights, 34 Bdequant_q8_0Précision entière 8 bits, tête de sortie quasi sans perte
F16 / F321 weightdirect nativeTenseurs non quantifiés (poids RMSNorm, biais)

Limites & exclusions

Pour préserver la stabilité du navigateur et la mémoire de l’onglet, certains formats sont explicitement refusés avec un message explicatif :

  • GGUF shardés : Les fichiers découpés en plusieurs morceaux (-00001-of-00005) ne sont pas acceptés. Brimkern streame par plages HTTP contiguës sur un fichier unique. Choisissez la version mono-fichier.
  • Projecteurs mmproj seuls : Les fichiers nommés mmproj-* contiennent les projecteurs de vision et ne peuvent pas tourner seuls sans modèle de langue.
  • Quantifications IQ à table de codes : Les formats IQ1, IQ2, IQ3_XXS, IQ4_XS utilisent des tables de codes non adaptées au calcul vectoriel direct en WGSL. Privilégiez Q3_K, Q4_K_M ou Q4_0.
  • Limites de mémoire (VRAM) : Les modèles jusqu’à 1.5B (~1,2 Go) tournent facilement sur mobile et laptop. Les modèles 3B à 4B (~2-2,6 Go) demandent 8 Go+ de RAM. Les modèles 7B (~4-5 Go) nécessitent 16 Go+ de RAM.

Le format .brik & le convertisseur

Un .brik est un GGUF ré-empaqueté pour le navigateur : poids déjà quantifiés en int4/int8, disposés pour qu'une couche soit une seule plage HTTP contiguë, tokenizer embarqué. Effet concret : le modèle se charge par plages (reprise possible, partiellement, vraiment hors-ligne ensuite) au lieu d'un téléchargement de plusieurs gigaoctets.

Vous pouvez convertir un GGUF vous-même, dans le navigateur. Le fichier ne quitte jamais votre machine : ouvrir le convertisseur.

Brimkern : moteur WebGPU open, conçu par Romain Khanoyan. IA locale, WebGPU, moteurs on-device.