GLM-5.3-Flash: Z.ai představil první nativně multimodální model řady GLM-5
Nálepky:
Z.ai 26. srpna 2026 oficiálně vypustil model GLM-5.3-Flash, jde o první nativně multimodální model v řadě GLM-5 a zároveň nejlevnější schopný kódovací model, jaký firma dosud vydala. Jde o model typu mixture-of-experts s 320 miliardami parametrů celkem, z nichž je aktivních 18 miliard na token, s kontextovým oknem přes milion tokenů a se schopností zpracovat i obrázky a video – weights jsou uvolněny pod licencí MIT na Hugging Face.
Zajímavost kolem uvedení: model se pod jménem GLM-5.3-Flash neobjevil rovnou. Týden předtím se na OpenRouteru a OpenCode anonymně objevil tajemný model přezdívaný „Ox Alpha“, který na chvíli tiše ovládl žebříčky používání, nabízel téměř neomezený bezplatný přístup a lámal benchmarky. Zhipu nakonec agentuře Bloomberg potvrdilo, že Ox Alpha vytvořilo samo, a oznámilo, že open-weights vyjdou téhož večera. Model přitom celou dobu běžel na čipech vyrobených v Číně.
Technicky stojí za nižšími náklady hybridní architektura kombinující sparse a lineární pozornost – kombinace lineární pozornosti KDA a řídké MLA pozornosti přináší zhruba 3× nižší výpočetní nároky na pozornost a 4,4× menší KV cache oproti „velkému“ GLM-5.3.
Výkon a cena: model dosahuje 84,3 bodu v Terminal-Bench 2.1 a 63,4 v DeepSWE v1.1, tedy blízko Claude Opus 4.8, a to za cenu 0,15 USD / 0,50 USD za milion tokenů. Je dostupný i v rámci předplatného GLM Coding Plan (Lite, Pro, Max) s trojnásobnou kvótou oproti předchozí verzi.
Pro zájemce o self-hosting: plné FP8 váhy zabírají zhruba 306 GiB a vyžadují GPU generace Hopper nebo novější, podporováno je nasazení přes SGLang, vLLM, TokenSpeed či KTransformers.
Zdroje: https://z.ai/blog/glm-5.3-flash
https://www.marktechpost.com/2026/08/26/z-ai-releases-glm-5-3-flash-a-320b-a18b-natively-multimodal-moe-with-a-1m-token-context/amp/
… reposted this!