يجذب مشروع على GitHub باسم Strata الانتباه بادعاء جريء: تشغيل نموذج Qwen3.8 Flash Next، وهو نموذج يضم 125 مليار معامل، على عتاد استهلاكي بسرعة 100 رمز في الثانية. المستودع، الذي نشره المطور Niko1221، يوفر تثبيتًا بنقرة واحدة لويندوز ولينكس، وقد جمع بالفعل أكثر من 11,000 نجمة.
الفكرة بسيطة. معظم النماذج التي تتجاوز 100 مليار معامل تتطلب عادةً وحدات معالجة رسومات في مراكز البيانات أو تجهيزات متعددة البطاقات. ويقول Strata إن بطاقة RTX 4090 واحدة كافية، ويغلّف الإعداد بالكامل بواجهة برمجية متوافقة مع OpenAI وAnthropic تعمل على localhost، مع إدخال صور اختياري.
ما الذي يقدمه Strata فعلاً
Strata ليس مجرد تنزيل نموذج. المستودع يجمع محرك استدلال مخصصًا، يُسمى أيضًا Strata، إلى جانب نصوص إعداد لكل من ويندوز ولينكس. تشير ملفات البناء إلى CMake وDockerfile ومجلد third_party/ggml، وهو الأساس نفسه الذي تستخدمه العديد من أدوات الاستدلال المحلي.
يوفر المشروع ملفي SETUP.bat وSTART-HERE.bat لمستخدمي ويندوز، بالإضافة إلى setup.sh وupdate.sh لنظام لينكس، ما يشير إلى أن الفريق يريد تجربة شبه خالية من الإعداد. وجود مجلد bench/results في المستودع يلمّح إلى أن رقم 100T/s يأتي من قياسات المطورين أنفسهم.
Qwen3.8 Flash Next على عتاد استهلاكي
النموذج في قلب القصة هو Qwen3.8 Flash Next، بنموذج 125B معامل. تشغيله محليًا يتطلب عادةً ذاكرة رسومات ضخمة، ولهذا فإن ادعاء 100T/s على بطاقة RTX 4090 واحدة هو الرقم الذي يكرره الجميع.
يكشف Strata أيضًا عن واجهة برمجية بنمط OpenAI وAnthropic على localhost، ما يعني أن المطورين يمكنهم توجيه أدواتهم وحزم SDK الحالية إلى أجهزتهم بدلاً من نقطة نهاية سحابية. ويُدرج إدخال الصور الاختياري كميزة، ما يشير إلى استخدام متعدد الوسائط.
كما هو الحال مع أي قياس على GitHub، الأرقام مُبلَّغ عنها ذاتيًا ولم يتم التحقق منها بشكل مستقل. تعامل مع رقم 100T/s كادعاء من المطورين حتى يعيد أطراف ثالثة إنتاجه.
- النموذج: Qwen3.8 Flash Next، 125B معامل


