La force d'une IA — sur la machine de vos visiteurs, sans coût supplémentaire.
Embarquez un assistant qui tourne entièrement dans le navigateur, sur le GPU du visiteur. Aucun serveur, aucune facture par token, aucune donnée qui sort de l'appareil. Vous façonnez ce qu'il fait avec un seul prompt.
Zéro coût d'inférence
Le calcul tourne sur le GPU de votre visiteur, pas sur un serveur. Aucune facture par token, aucun rate-limit, scale infini. Tarif fixe, usage illimité.
Privé par construction
Les données ne quittent jamais le navigateur. Rien ne transite par nous — un argument décisif pour les sites sensibles (santé, juridique, RH).
Aucun serveur, aucune ops
Pas de flotte GPU à opérer, pas de scaling à gérer, pas de clés d'API à faire tourner. Le modèle streame une fois depuis un CDN et reste en cache sur l'appareil.
Façonnée par un prompt
Vous définissez ce que fait l'IA avec une consigne prédéfinie — son rôle, sa logique, ses garde-fous. Pas de fine-tuning, pas de data scientist requis.
Essaie — classer, extraire & discuter, sur ton GPU
Un modèle ultra-léger (LFM2.5 230M) classe, extrait et discute — même en français — façonné par un prompt, tournant entièrement dans ton navigateur (sans serveur). La 1ʳᵉ fois il se télécharge (~149 Mo), ensuite c’est en cache & hors ligne.
Comment ça marche
Posez une balise <script> et écrivez la consigne qui façonne l’assistant.
À la première utilisation, un modèle léger streame depuis un CDN et se met en cache sur l’appareil (ensuite c’est instantané, même hors ligne).
Chaque requête tourne sur le GPU du visiteur via nos kernels WebGPU — rien n’est envoyé où que ce soit.
Ce qu’elle fait très bien
Un modèle léger on-device brille sur les tâches cadrées — celles qu'un bon prompt définit entièrement :
Embarquez-la sur votre site — SDK v0
Le SDK est disponible. Une balise script monte l’assistant ; un prompt le façonne. Le modèle ne se télécharge que quand un visiteur ouvre le widget — le score de votre page reste intact.
<script src="https://brimkern.com/sdk.js"></script>
<script>
Brimkern.embed({
system: 'Tu es l’assistant de support d’Acme, amical et concis.',
});
</script>Voir une intégration live v0 — widget de chat, URL de modèle LFM2 .brik, couleurs & libellés, exemples few-shot, et documents de connaissance (il répond sur VOTRE contenu, sélectionné en local, rien n’est envoyé nulle part). Les outils arrivent ensuite. Sur le modèle 230M par défaut, gardez des notes courtes et factuelles : il les cite bien, mais il peut confondre deux nombres présents dans le même paragraphe.
Notre propre moteur, pas une boîte noire
Des kernels WebGPU maison exécutent le modèle ; les poids sont livrés dans notre format compact BRIK, quantifiés jusqu'en int3 et streamés en secondes, puis mis en cache. Le modèle est choisi pour tenir — le chargeur lit même le GPU et la connexion du visiteur pour recommander le bon.
Fonctionne dans les navigateurs modernes avec WebGPU (Chrome, Edge, Safari, Firefox). Idéal pour des tâches bien cadrées — pas du raisonnement ouvert. Le premier chargement télécharge le modèle une fois ; ensuite chaque visite est instantanée et disponible hors ligne.
Brimkern — inférence WebGPU locale. Le SDK embarquable (v0) est disponible et gratuit — le moteur est open source (MIT).
Brimkern — moteur WebGPU open, conçu par Romain Khanoyan. IA locale, WebGPU, moteurs on-device.