Kimi K3: otvorený multimodálny model pre dlhé agentické úlohy
Kimi K3 je vlajkový open-weight model od Moonshot AI. Spája natívne vizuálne porozumenie, kontextové okno s približne miliónom tokenov a architektúru Mixture-of-Experts určenú na dlhé kódovacie, výskumné a znalostné workflow. Nie je to iba väčší nástupca Kimi K2.5: mení attention architektúru, výrazne zvyšuje mieru sparsity a cieli na úlohy, pri ktorých agent pracuje s repozitárom, terminálom alebo vizuálnou spätnou väzbou počas mnohých krokov.
Čo je oficiálne potvrdené
| Vlastnosť | Kimi K3 |
|---|---|
| Celkové parametre | 2,8 bilióna |
| Aktívne parametre | 104 miliárd na token |
| Architektúra | MoE, Kimi Delta Attention, Gated MLA, Attention Residuals |
| Experti | 896; vyberá 16 plus 2 zdieľané |
| Kontext | 1 048 576 tokenov |
| Modalita | text a obraz; hostované rozhranie dokumentuje aj video vstup |
| Vision encoder | MoonViT‑V2, 401 miliónov parametrov |
| API model ID | kimi-k3 |
| Reasoning | vždy zapnutý; low, high, max |
| Váhy | verejné na Hugging Face pod vlastnou Kimi K3 licenciou |
Čísla pochádzajú z model card Moonshot AI. Výrobca označuje K3 za prvý otvorený model v triede troch biliónov parametrov. „Open-weight“ však neznamená automaticky Apache alebo MIT licenciu: repozitár používa osobitnú Kimi K3 License, ktorú treba pred komerčným nasadením prečítať.
Prečo je architektúra dôležitá
K3 kombinuje Kimi Delta Attention (KDA) s vrstvami Gated MLA. Attention Residuals majú zlepšiť tok informácií v hlbokom modeli a pri dlhých sekvenciách. Stable LatentMoE aktivuje iba malú časť z 896 expertov. Moonshot uvádza približne 2,5‑násobnú efektivitu škálovania oproti K2, no ide o tvrdenie výrobcu, nie o univerzálnu garanciu rýchlosti.
MoE šetrí výpočty oproti dense modelu s rovnakým celkovým počtom parametrov, ale K3 zostáva extrémne veľký. 104 miliárd aktívnych parametrov a 2,8 bilióna uložených parametrov znamenajú, že plný self-hosting nie je bežná úloha pre jednu pracovnú stanicu. Pre väčšinu tímov bude praktickejší Moonshot API alebo špecializovaný inference cluster.
Dlhé agentické kódovanie
Moonshot cieli K3 na úlohy, pri ktorých nestačí vygenerovať jednu funkciu:
- orientácia vo veľkom repozitári a dlhé refaktory,
- koordinácia terminálových nástrojov,
- vývoj s vizuálnou spätnou väzbou, napríklad frontend, hry alebo CAD,
- výskum s veľkým množstvom dokumentov,
- tvorba dashboardov, interaktívnych výstupov a multimediálnych artefaktov.
Miliónový kontext pomáha, ale nie je náhradou za dobrú správu stavu. Pri dlhom agentickom behu stále treba uchovávať plán, rozhodnutia, výsledky testov a rollback body. Viac kontextu zvyšuje aj cenu a čas spracovania; relevantné súbory je lepšie vyberať než bez rozmyslu posielať celý disk.
API a reasoning effort
Kimi API používa OpenAI-kompatibilný klient a base URL https://api.moonshot.ai/v1. K3 má reasoning vždy zapnutý. Úroveň max je predvolená, no pre lacnejšie alebo rýchlejšie kroky možno zvoliť low či high.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
reasoning_effort="high",
messages=[
{"role": "user", "content": "Navrhni testovací plán pre tento refaktor."}
],
)
print(response.choices[0].message.content)
Pri streamovaní API oddeľuje reasoning_content od finálneho content. Pri viacotáčkových tool calloch dokumentácia odporúča vrátiť do ďalšieho requestu kompletnú assistant správu, nie iba finálny text. K3 podporuje function calling, tool_choice, štruktúrovaný JSON výstup a dynamické načítanie nástrojov.
Kedy zvoliť K3
Dáva zmysel, keď úloha kombinuje dlhý kontext, kód, nástroje a obrazové vstupy alebo keď chceš experimentovať s otvorenými frontier váhami. Zaujímavý je aj pre výskumné tímy, ktoré potrebujú upraviť inference stack a vedia prevádzkovať veľký MoE model.
Nemusí byť najlepšou voľbou, ak potrebuješ nízku latenciu, lacný jednoduchý chat alebo lokálne nasadenie na jednom GPU. Na krátke klasifikačné a extrakčné úlohy je menší model zvyčajne hospodárnejší. Pri slovenských textoch treba kvalitu overiť na vlastnom datasete; oficiálna karta negarantuje rovnakú úroveň pre každý jazyk a doménu.
Bezpečnostné a verifikačné pravidlá
Agent s terminálom alebo write prístupom môže urobiť chybu bez ohľadu na benchmark. Produkčný workflow by mal mať:
- minimálne oprávnenia a izolované pracovné prostredie,
- explicitné schvaľovanie deštruktívnych alebo externých akcií,
- testy, linter a diff review pred merge,
- limity na počet krokov, tokeny a náklady,
- kontrolu citlivých dát odosielaných do hostovaného API.
Benchmarky v technickom reporte sú užitočné na orientáciu, ale často používajú špecifický harness, effort a token budget. Najlepší výber dá až rovnaká eval sada na tvojich úlohách.