Qwen3.8‑Max: Max model s otvorenými váhami pre coding a cowork
Qwen3.8‑Max je vlajkový model rodiny Qwen od Alibaba/Qwen Team, oficiálne predstavený 3. augusta 2026. Nadväzuje na architektonický základ Qwen 3.5, ale škáluje na 2,4 bilióna parametrov a cieli na dlhé agentické úlohy: programovanie, výskum, profesionálnu prácu a multimodálne workflow s opakovanou kontrolou výsledku.
Dôležité je rozlišovať dve vrstvy produktu:
- Qwen3.8‑Max v QwenCloud je hostovaný model s vision vstupom, voliteľným non-thinking režimom, miliónovým kontextom, zabudovanými nástrojmi a kompatibilnými API protokolmi.
- Qwen3.8‑2.4T‑A95B je verejný open-weight checkpoint. Model card ho opisuje ako textový causal language model s natívnym kontextom 262 144 tokenov, rozšíriteľným približne na 1,01 milióna.
Tieto vlastnosti sa nemajú automaticky prenášať medzi API a self-hosted checkpointom.
Základné parametre otvoreného modelu
| Vlastnosť | Qwen3.8‑2.4T‑A95B |
|---|---|
| Celkové parametre | 2,4 bilióna |
| Aktívne parametre | 95 miliárd |
| Vrstvy | 92 |
| MoE | 512 expertov; 10 routovaných + 1 zdieľaný |
| Architektúra | Gated DeltaNet, Gated Attention, MoE |
| Natívny kontext | 262 144 tokenov |
| Rozšírený kontext | približne 1 010 000 tokenov |
| Dostupnosť | QwenCloud, Hugging Face, ModelScope |
| Licencia | osobitná Qwen3.8‑Max licencia |
Qwen zverejnil aj menší Qwen3.8‑27B a FP8 varianty. Menší model je realistickejší na vlastnú infraštruktúru; plný 2,4T checkpoint je aj pri 95B aktívnych parametroch veľký distribuovaný systém, nie bežný lokálny model.
Na čo je Qwen3.8‑Max stavaný
Launch materiály zdôrazňujú štyri oblasti:
- Dlhé coding agenty – model má plánovať, implementovať, spúšťať testy, opravovať chyby a pracovať so spätnou väzbou prostredia.
- Cowork a znalostná práca – viacstupňové úlohy s dokumentmi, tabuľkami, prezentáciami a profesionálnymi výstupmi.
- Výskum – reprodukcia experimentu, iterácia hypotéz a tvorba overiteľného artefaktu namiesto samotnej odpovede.
- Multimodálne agenty – hostovaný Max môže používať obraz ako vstup aj ako spätnú väzbu pri tvorbe webu, videa, 3D scény alebo aplikácie.
Qwen prezentuje viacero dlhých autonómnych demonštrácií. Sú užitočné ako ukážky schopností, nie ako garancia, že každý agentický beh vydrží dni bez dozoru. Pri hodnotení treba odlíšiť model od harnessu, nástrojov, časového limitu a množstva pokusov.
Reasoning a zachovanie myslenia
QwenCloud podporuje reasoning_effort s úrovňami low, medium a xhigh. Vyššia úroveň dá modelu väčší priestor na zložité rozhodnutia, ale zvyšuje latenciu a spotrebu tokenov. preserve_thinking je podľa launch dokumentácie predvolene zapnuté, aby sa reasoning kontext zachoval medzi krokmi.
Praktický routing:
low– extrakcia, jednoduché úpravy, opakované pomocné kroky,medium– bežný produkčný default pre coding a dokumentové úlohy,xhigh– architektúra, zložité debugovanie, dlhé autonómne úlohy.
Pri hostovanom modeli možno zvoliť aj non-thinking režim. Open checkpoint a konkrétny inference runtime však môžu mať odlišné parametre, parsery a limity; vždy sa riaď dokumentáciou verzie, ktorú skutočne spúšťaš.
Integrácia
QwenCloud dokumentuje OpenAI-compatible Chat Completions a Responses API aj rozhranie kompatibilné s Anthropic Messages. To uľahčuje pripojenie existujúcich agentických nástrojov, ale kompatibilita protokolu neznamená identické správanie všetkých polí.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url=os.environ["DASHSCOPE_BASE_URL"],
)
response = client.chat.completions.create(
model="qwen3.8-max",
reasoning_effort="medium",
messages=[
{"role": "user", "content": "Analyzuj issue, navrhni patch a testy."}
],
)
print(response.choices[0].message.content)
Presný base URL a podporované rozšírenia over v aktuálnom QwenCloud účte a API dokumentácii.
Kedy ho zvoliť
Qwen3.8‑Max je zaujímavý, keď potrebuješ silný coding/cowork model, multimodálnu spätnú väzbu a dlhý kontext v jednom hostovanom produkte. Open checkpoint dáva zmysel organizáciám s veľkým GPU clusterom, vlastným inference tímom alebo požiadavkou na kontrolu dát a runtime.
Pre menší rozpočet alebo edge nasadenie bude praktickejší 27B variant. Na krátke API úlohy môže byť Max zbytočný; menší model s presným promptom často poskytne lepší pomer cena/latencia. Aktuálny cenník sa mení, preto článok neuvádza statické ceny.
Limity a overovanie
- Licencia nie je automaticky Apache 2.0; pred redistribúciou skontroluj Qwen3.8‑Max License.
- Rozšírenie kontextu nad natívnych 262K môže meniť kvalitu a nároky na pamäť.
- Výsledky benchmarkov z launch materiálov sú výsledky výrobcu a používajú konkrétne harnessy.
- Multimodalita hostovaného Max modelu neznamená, že rovnaký vstup podporuje textový open checkpoint.
- Pri agentoch používaj sandbox, minimálne oprávnenia, testy a ľudský review pred externými alebo deštruktívnymi akciami.