Přejít k navigační liště

Zdroják » Zprávičky » DeepSeek V4 Flash 0731 exceluje na benchmarku ARC-AGI

DeepSeek V4 Flash 0731 exceluje na benchmarku ARC-AGI

Zprávičky AI

Nálepky:

Společnost DeepSeek zveřejnila 31. července 2026 model V4 Flash 0731 ve třech úrovních „reasoning“ nastavení (Low, High, Max), a výsledky na benchmarku ARC Prize, který testuje schopnost obecné abstraktní usuzování u AI systémů, jsou působivé.

Klíčová čísla:

  • Na verzi ARC-AGI-1 dosáhl model v nejvyšším režimu (Max) skóre 89,0 %, a to za cenu pouhých 0,02 dolaru na úlohu
  • Na náročnější ARC-AGI-2 model v režimu Max skóroval 61,4 % za 0,04 dolaru na úlohu
  • Nižší úrovně (High a Low) dosahují o něco slabších výsledků – 87 %/56 % a 84 %/46 % na ARC-AGI-1, resp. ARC-AGI-2

Poměr cena/výkon je pozoruhodný – DeepSeek tak pokračuje v trendu nabízet konkurenceschopné výsledky za zlomek nákladů oproti západním modelům. Pro ARC-AGI-3 zatím výsledky chybí.

Model i příslušný paper jsou veřejně dostupné (na Hugging Face a arXivu).

Zdroj: https://arcprize.org/results/deepseek-v4-flash-0731

Komentáře

Odebírat
Upozornit na
guest
0 Komentářů
Nejstarší
Nejnovější Nejvíce hlasů

Fronta před rychlým backendem. Co ukázal veřejný test eDokladů

Veřejný zátěžový test eDokladů přinesl zdánlivě protichůdný výsledek: aplikační servery odpovídaly v milisekundách, zatímco část lidí čekala desítky sekund. Za hlavní omezení závěrečná analýza DIA označila vstupní bránu, jejíž automatické škálování nestačilo na náhlý náběh provozu. Test zároveň ukázal, proč samotný generátor HTTP požadavků nenahradí identity skutečných uživatelů a jejich zařízení.