Přejít k navigační liště

Zdroják » Zprávičky » GLM-5.3-Flash: Z.ai představil první nativně multimodální model řady GLM-5

GLM-5.3-Flash: Z.ai představil první nativně multimodální model řady GLM-5

Zprávičky AI

Z.ai 26. srpna 2026 oficiálně vypustil model GLM-5.3-Flash, jde o první nativně multimodální model v řadě GLM-5 a zároveň nejlevnější schopný kódovací model, jaký firma dosud vydala. Jde o model typu mixture-of-experts s 320 miliardami parametrů celkem, z nichž je aktivních 18 miliard na token, s kontextovým oknem přes milion tokenů a se schopností zpracovat i obrázky a video – weights jsou uvolněny pod licencí MIT na Hugging Face.

Zajímavost kolem uvedení: model se pod jménem GLM-5.3-Flash neobjevil rovnou. Týden předtím se na OpenRouteru a OpenCode anonymně objevil tajemný model přezdívaný „Ox Alpha“, který na chvíli tiše ovládl žebříčky používání, nabízel téměř neomezený bezplatný přístup a lámal benchmarky. Zhipu nakonec agentuře Bloomberg potvrdilo, že Ox Alpha vytvořilo samo, a oznámilo, že open-weights vyjdou téhož večera. Model přitom celou dobu běžel na čipech vyrobených v Číně.

Technicky stojí za nižšími náklady hybridní architektura kombinující sparse a lineární pozornost – kombinace lineární pozornosti KDA a řídké MLA pozornosti přináší zhruba 3× nižší výpočetní nároky na pozornost a 4,4× menší KV cache oproti „velkému“ GLM-5.3.

Výkon a cena: model dosahuje 84,3 bodu v Terminal-Bench 2.1 a 63,4 v DeepSWE v1.1, tedy blízko Claude Opus 4.8, a to za cenu 0,15 USD / 0,50 USD za milion tokenů. Je dostupný i v rámci předplatného GLM Coding Plan (Lite, Pro, Max) s trojnásobnou kvótou oproti předchozí verzi.

Pro zájemce o self-hosting: plné FP8 váhy zabírají zhruba 306 GiB a vyžadují GPU generace Hopper nebo novější, podporováno je nasazení přes SGLang, vLLM, TokenSpeed či KTransformers.

Zdroje: https://z.ai/blog/glm-5.3-flash
https://www.marktechpost.com/2026/08/26/z-ai-releases-glm-5-3-flash-a-320b-a18b-natively-multimodal-moe-with-a-1m-token-context/amp/

Komentáře

Odebírat
Upozornit na
guest
0 Komentářů
Nejstarší
Nejnovější Nejvíce hlasů
AI

… reposted this!

Fronta před rychlým backendem. Co ukázal veřejný test eDokladů

Veřejný zátěžový test eDokladů přinesl zdánlivě protichůdný výsledek: aplikační servery odpovídaly v milisekundách, zatímco část lidí čekala desítky sekund. Za hlavní omezení závěrečná analýza DIA označila vstupní bránu, jejíž automatické škálování nestačilo na náhlý náběh provozu. Test zároveň ukázal, proč samotný generátor HTTP požadavků nenahradí identity skutečných uživatelů a jejich zařízení.

Cloudflare otevřel zdrojové kódy Cloudflare OS – platformy pro AI agenty, aplikace a firemní práci

AI
Komentáře: 0
Cloudflare otevřel zdrojové kódy Cloudflare OS – platformy, kterou si přes rok testoval sám na sobě a která má dát každému zaměstnanci ve firmě AI agenta rozumějícího interním systémům, procesům a datům. Klíčové na celém řešení není samotné psaní kódu agentem, ale bezpečnostní model postavený na nulovém výchozím přístupu a takzvaných Gatekeeperech, které hlídají nejen to, jaká data agent smí číst, ale i kam se dál mohou dostat.