Un projet GitHub nommé Strata attire l'attention avec une affirmation audacieuse : faire tourner Qwen3.8 Flash Next, un modèle de 125 milliards de paramètres, sur du matériel grand public à 100 tokens par seconde. Le dépôt, publié par le développeur Niko1221, propose une installation en un clic pour Windows et Linux et a déjà récolté plus de 11 000 étoiles.
L'argument est simple. La plupart des modèles de plus de 100 milliards de paramètres exigent normalement des GPU de centre de données ou des configurations multi-cartes. Strata affirme qu'une seule RTX 4090 suffit, et enveloppe toute la configuration dans une API compatible OpenAI et Anthropic servie sur localhost, avec entrée d'image en option.
Ce que propose réellement Strata
Strata n'est pas qu'un simple téléchargement de modèle. Le dépôt regroupe un moteur d'inférence maison, également appelé Strata, ainsi que des scripts d'installation pour Windows et Linux. Les fichiers de build renvoient à CMake, un Dockerfile et un dossier third_party/ggml, la même base utilisée par de nombreux outils d'inférence locale.
Le projet fournit les fichiers SETUP.bat et START-HERE.bat pour les utilisateurs Windows, plus setup.sh et update.sh pour Linux, ce qui suggère une expérience quasi sans configuration. Un dossier bench/results dans le dépôt indique que le chiffre de 100T/s provient des propres benchmarks des développeurs.
Qwen3.8 Flash Next sur du matériel grand public
Le modèle au cœur de l'histoire est Qwen3.8 Flash Next, un modèle à 125B paramètres. L'exécuter localement exigerait normalement une importante mémoire GPU, c'est pourquoi l'affirmation de 100T/s sur une seule RTX 4090 est le chiffre que tout le monde répète.
Strata expose aussi une API de style OpenAI et Anthropic sur localhost, ce qui signifie que les développeurs peuvent pointer leurs outils et SDK existants vers leur propre machine plutôt que vers un point de terminaison cloud. L'entrée d'image optionnelle est listée comme fonctionnalité, ce qui suggère un usage multimodal.


