IT Новини

Новият крал на изкуствения интелект: Qwen 3.8-Max превъзхожда GPT-5.6 Sol Max и Fable 5 в тестовете за агентски задачи

Китайската компания Alibaba представи новия си флагмански ИИ-модел Qwen3.8-Max, който, според данните на компанията, е постигнал едни от най-добрите резултати сред големите езикови модели в тестове за автономна работа, програмиране и мултимодално мислене. В редица бенчмарк тестове моделът надминава показателите на GPT-5.6 Sol Max, Claude Fable 5 и Gemini 3.1 Pro, но публикуваните резултати все още се нуждаят от независима проверка. Едно от постиженията на Qwen3.8-Max на Alibaba е резултатът в бенчмарка OSWorld-Verified, който оценява способността на ИИ-агентите да взаимодействат с компютърни среди и да изпълняват многоетапни задачи. Моделът събра 86,1 точки и изпревари Claude Fable 5 (85,0), GPT-5.6 Sol Max (83,2) и Gemini 3.1 Pro (76,2). Qwen3.8-Max показа високи резултати и в други специализирани тестове. В бенчмарка PaperBench, който оценява способността за анализ и възпроизвеждане на научни изследвания, моделът получи 93 точки. В TerminalBench 2.1, който проверява работата с командния ред, резултатът беше 86,6 точки. Освен това, Alibaba заяви, че моделът е лидер в тестовете Vision2Web (69,0), LVBench (81,8) и ERQA (77,8), свързани с визуален анализ, уеб задачи и мултимодално разсъждение. Qwen3.8-Max не е тотален лидер Въпреки това Qwen3.8-Max не се превърна в абсолютен лидер във всички категории. Например, в тестовете за разработка на софтуер SWE-Pro водещите позиции запазват...

Прочети оригиналната статия →


Източник: www.kaldata.com
💬
Информационен асистент ?