Outils IA · 6 min · 2026-08-05 · Par Équipe MaitriseLIA
TurboFieldfare : un LLM de 26 milliards de paramètres dans 2 Go de RAM sur ton Mac — prouesse ou magie ?
Faire tourner un modèle de 26 milliards de paramètres dans 2 Go de RAM sur un MacBook ? TurboFieldfare le fait, et Hacker News a validé. C’est une vraie prouesse d’ingénierie — à condition de comprendre les trois compromis que « 2 Go » cache.
TL;DR — TurboFieldfare en une minute
- Ce que c’est : un runtime Swift + Metal (open source, Apache 2.0, 5k+ étoiles, 905 points sur Hacker News) qui fait tourner Gemma 4 26B dans ~2 Go de RAM sur un Mac Apple Silicon.
- Le bonus : il expose un serveur compatible OpenAI en local — tu le branches comme un modèle cloud, mais gratuit et 100 % sur ta machine.
- Le « 26B en 2 Go » est vrai, mais c’est de l’ingénierie, pas de la magie : modèle MoE (26B au total, ~4B actifs par token), qui streame les experts depuis le SSD et tourne en 4-bit.
- Les 3 compromis : ce n’est pas un dense 26B, c’est lent sur Mac modeste (5-6 tokens/s sur M2), et la qualité 4-bit demande de vérifier les résultats importants.
- Notre verdict : à tester — excellent pour de l’inférence locale, privée et gratuite, si tu acceptes la contrepartie de vitesse.
« Un modèle de 26 milliards de paramètres qui tourne dans 2 Go de RAM sur un MacBook. » Le post a fait 905 points sur Hacker News — le genre de score qui, dans ce public d’ingénieurs, signale du solide, pas du buzz. Et c’est vrai. Mais comme toute prouesse, elle repose sur des choix qu’il faut comprendre avant de crier au miracle.
La promesse : un gros modèle, en local, sans exploser la RAM
Faire tourner un LLM en local sur un Mac, c’est séduisant : gratuit, privé, hors-ligne. Le problème, c’est la mémoire : un modèle de 26B en pleine précision demande des dizaines de Go de RAM. La plupart des Macs ne suivent pas.
TurboFieldfare renverse la contrainte : il fait tenir ce modèle dans 2 Go. Et il l’expose via un serveur compatible OpenAI (en local, sur 127.0.0.1) — autrement dit, n’importe quel outil qui parle à l’API d’OpenAI peut lui parler à lui, mais sans cloud et sans facture.
Comment il tient dans 2 Go (le vrai génie)
C’est là qu’est l’ingénierie, et elle mérite le détour. Trois techniques :
- Un modèle MoE (Mixture of Experts). Gemma 4 26B ici, c’est 26 milliards de paramètres au total, mais seulement ~4 milliards actifs pour générer chaque token. On ne charge pas tout d’un coup.
- Le streaming des experts. TurboFieldfare garde en RAM un cœur partagé (~1,35 Go) et le cache, puis va chercher sur le SSD, à la volée, uniquement les experts nécessaires à chaque token. La RAM reste basse ; le disque fait le gros du travail.
- La quantification 4-bit et un cache d’experts (LFU, 16 emplacements) pour limiter les allers-retours disque.
C’est propre, malin, et écrit sur mesure (pas un simple wrapper). Chapeau à l’auteur.
Les 3 compromis que « 2 Go » cache
Maintenant, l’honnêteté. « 26B en 2 Go » est vrai, mais ne veut pas dire « un modèle frontier gratuit sur n’importe quel Mac ». Trois nuances :
- Ce n’est pas un dense 26B. C’est un MoE avec ~4B actifs. La qualité est celle d’un modèle de cette taille effective — bonne pour beaucoup d’usages, pas au niveau des géants.
- C’est lent sur un Mac modeste. Le prix du « 2 Go », c’est le streaming SSD, qui devient le goulot. Résultat : 5 à 6 tokens/seconde sur un M2 8 Go (utilisable mais lent pour de l’interactif), contre 31-35 tokens/s sur un M5 Pro 24 Go. Plus ta machine a de RAM, moins elle streame, plus c’est rapide.
- La qualité 4-bit demande de la vigilance. Le README le dit noir sur blanc : le modèle « peut se répéter ou donner des réponses incorrectes, vérifiez les résultats importants ». À ne pas utiliser aveuglément sur du critique.
Ajoute que c’est text-only, que le serveur est en loopback sans TLS ni authentification, et que le projet est jeune (expérimental, optimisations à venir).
Pour qui c’est vraiment utile
- Tu es sur Mac Apple Silicon (minimum un M2 8 Go) et tu veux un LLM local, privé, gratuit : c’est une porte d’entrée bluffante.
- Tu veux garder tes données sur ta machine (documents sensibles, RGPD) : rien ne part dans le cloud.
- Tu veux brancher du local dans un pipeline existant : le serveur compatible OpenAI se substitue à un modèle cloud en changeant juste l’URL.
À l’inverse, si tu as besoin de vitesse interactive sur un Mac d’entrée de gamme, ou d’une qualité frontier, ce n’est pas encore ça.
Notre verdict : à tester
TurboFieldfare est le genre de projet qui fait avancer tout le monde : il montre qu’avec de l’ingénierie fine, un gros modèle peut tourner sur du matériel modeste, en local et gratuitement. Pour l’inférence privée sur Mac, c’est une pièce sérieuse à essayer.
La seule chose à désapprendre, c’est le raccourci « 26B en 2 Go = frontier gratuit pour tous ». La réalité est plus nuancée — MoE, streaming, 4-bit — et c’est justement ce qui la rend crédible. Benchmarke-le sur ta machine : si la vitesse te convient, tu tiens un modèle local puissant qui ne coûte rien et ne fait rien sortir de chez toi.
Points de vigilance
- Benchmarke sur ta machine : 5-6 tokens/s sur M2, bien plus sur un Mac à grosse RAM. La vitesse dépend de ton hardware.
- Vérifie les sorties importantes : la quantification 4-bit peut se tromper ou se répéter.
- Serveur local non sécurisé : loopback sans TLS/auth — à ne pas exposer sur le réseau.
- Text-only et jeune : pas d’image/audio/vidéo, projet expérimental — garde-le pour ce qu’il fait bien aujourd’hui.
Sources
À propos de l'auteur
Équipe MaitriseLIA
Experts en formation Claude Code, Anthropic API et outils d'IA professionnels. Nos contenus sont rédigés par des spécialistes qui utilisent Claude Code et les MCPs au quotidien pour automatiser leurs business.