Strata, un moteur d'inférence open source sous licence MIT, fait tourner Qwen 3.8 Flash Next, un modèle de 125 milliards de paramètres sur un PC équipé d'une d’une GPU NVIDIA (GeForce RTX séries 20 à 50) ou AMD (Radeon RX 6800 et au-delà) avec au moins 12 Go de RAM, sous Windows ou Linux. Strata répartit le travail entre GPU, RAM, CPU et stockage. La RAM nécessaire dépend de la variante et du GPU, 32 Go au minimum, et il faut environ 80 Go d'espace disque libre. Le modèle discute, écrit du code, lit des images (avec des restrictions sur AMD) et sert les agents de codage par une API compatible OpenAI et Anthropic sur localhost. L'inférence est locale.Mesures publiées par les auteurs : 94 tokens par seconde en écriture et 2 650 en lecture de prompt sur une RTX 5070 avec 12 Go, avec 64 Go de RAM et une quantification Q2_0 ; 60 et 1 160 sur une RX 9070 XT, avec environ 47 Go de RAM.L'installation est assistée : un double-clic sur START-HERE.bat sous Windows, setup.sh sous Linux, ou un prompt à confier à son agent. La version 0.1.39 du 4 octobre accélère le décodage d'environ 6 % sur certaines configurations, accepte en option plusieurs requêtes à la fois, ce qui peut ralentir une carte de 12 Go, et ajoute l'API Response d'OpenAI pour Codex.GitHub : https://github.com/Niko1221/StrataCatégorie actualité: IAQwenImage actualité AMP:
Strata, un moteur d'inférence open source sous licence MIT, fait tourner Qwen 3.8 Flash Next, un modèle de 125 milliards de paramètres sur un PC équipé d'une d’une GPU NVIDIA (GeForce RTX séries 20 à 50) ou AMD (Radeon RX 6800 et au-delà) avec au moins 12 Go de RAM, sous Windows ou Linux. Strata répartit le travail entre GPU, RAM, CPU et stockage. La RAM nécessaire dépend de la variante et du GPU, 32 Go au minimum, et il faut environ 80 Go d'espace disque libre.

Le modèle discute, écrit du code, lit des images (avec des restrictions sur AMD) et sert les agents de codage par une API compatible OpenAI et Anthropic sur localhost. L'inférence est locale.
Mesures publiées par les auteurs : 94 tokens par seconde en écriture et 2 650 en lecture de prompt sur une RTX 5070 avec 12 Go, avec 64 Go de RAM et une quantification Q2_0 ; 60 et 1 160 sur une RX 9070 XT, avec environ 47 Go de RAM.
L'installation est assistée : un double-clic sur START-HERE.bat sous Windows, setup.sh sous Linux, ou un prompt à confier à son agent. La version 0.1.39 du 4 octobre accélère le décodage d'environ 6 % sur certaines configurations, accepte en option plusieurs requêtes à la fois, ce qui peut ralentir une carte de 12 Go, et ajoute l'API Response d'OpenAI pour Codex.
GitHub : https://github.com/Niko1221/Strata
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | Купил мини‑ПК с приставкой «AI» ради локальной LLM. Что может NPU на самом деле | 0 | 10.63 | 01-10-2026 |
| 2 | Прорыв GPT-6 Astra, Claude взрослеет до версии 5.5, скандал вокруг задачи Навье-Стокса: главные события в ИИ за сентябрь | 0 | 14.03 | 02-10-2026 |
| 3 | Earendil publie Pi 1.0, son harnais d'agent minimal | 0 | 10.7 | 08-10-2026 |
| 4 | Todo lo que puedes hacer con OpenClaw gracias a su app para iPhone y Android | 0 | 17.36 | 22-08-2026 |
| 5 | 'Welcome to the AGI era': OpenAI launches GPT-6 Astra | 0 | 6.38 | 03-09-2026 |
| 6 | GPT, Claude, and Gemini in one browser tab for $39.99, for life | 0 | 14.36 | 03-10-2026 |
| 7 | OpenAI shipped Dots on Tuesday. By Wednesday night my terminal had its own, running 100% locally | 0 | 10 | 30-09-2026 |
| 8 | Нафиг NVIDIA! Я запустил Qwen на FPGA за $50 — а свой TPU назвал бы «КЕДР». Часть 1 | 0 | 15.59 | 09-10-2026 |
| 9 | Главное за 29 сентября в одном ролике: 01. Anthropic выпустила ... | 0 | 15.23 | 29-09-2026 |