Китайската Alibaba представи новия си мултимодален модел Qwen3.8-Omni-Flash, който може да обработва директно текст, изображения, аудио и видео и е насочен не само към анализ на съдържание, а и към AI агенти, изпълняващи поредица от задачи.

Една от по-съществените промени обаче не е в поредната таблица с резултати от тестове, а в цената. Според Alibaba разходът за обработване на един час аудио е намален с над 98% спрямо предишния Qwen3.5-Omni-Plus, а при комбинирано аудио и видео понижението е над 93%.

Това може да направи икономически по-практични приложения, при които изкуственият интелект редовно обработва цели срещи, записи, видеоматериали или заснети екрани, вместо те предварително да бъдат превръщани в текст.

Един милион токена контекст

Qwen3.8-Omni-Flash може да обработва наведнъж до около 1 млн. токена - техническата единица, с която AI системите измерват количеството информация, което могат да поберат в "работната си памет".

За обикновения потребител по-важното е какво означава това на практика: вместо да му се подават кратки откъси един по един, моделът може да работи с много голям обем материал в рамките на една задача - например продължителни записи от срещи, множество документи, изображения, звук и видео. Така AI може да търси връзки между информация от различни части на материала, без тя предварително да бъде раздробявана на десетки отделни заявки.

Още по-същественото при новия модел е, че тази информация не е задължително първо да бъде превърната в текст. Qwen3.8-Omni-Flash може директно да обработва картина и звук. Например при запис на работна среща той би могъл едновременно да следи какво се казва, какво е показано на презентацията и каква информация се появява на екрана, а след това да изготви резюме или да изпълни друга зададена му задача.

От "разбери видеото" към "свърши задачата"

Alibaba поставя специален акцент върху т.нар. agentic възможности - моделът да не се ограничава до въпроси и отговори за дадено видео или аудио, а да планира последователност от действия и да използва инструменти.

Компанията демонстрира приложения за обработване и редактиране на видео, работа със срещи, превод и аудиовизуални изследвания. Официалната документация посочва като практически приложения анализ на аудио и видео, изготвяне на резюмета от срещи и генериране на субтитри.

При дълги видеоматериали подходът може да бъде и селективен - агентът да търси необходимите моменти и да използва инструменти, вместо да обработва по един и същи начин целия материал. В публикуваните от Alibaba резултати за OmniVideoBench подобен подход повишава резултата от 63,4 на 67,8 точки, докато използваните токени намаляват с 45,7%. Данните са на самата компания и следва да се разглеждат като резултати, заявени от производителя.

Alibaba твърди още, че при 29 теста новият модел постига средно подобрение от над 25% спрямо Qwen3.5-Omni-Plus. Компанията го сравнява и с Gemini 3.8 Flash на Google, като заявява близки резултати при аудиовизуалните задачи и по-добро общо представяне при аудио. И тук става дума за тестове и методология, представени при премиерата на Qwen, а не за независимо цялостно сравнение между моделите.

По-важното число може да се окаже цената

За масовото използване на подобни модели намаляването на разходите за аудио и видео може да се окаже поне толкова важно, колкото подобряването на резултатите в тестовете.

Досега постоянното подаване на часове записи към мултимодален AI може бързо да натрупа значителна сметка. При много по-ниска цена стават по-реалистични системи, които обработват цели работни срещи, лекции, интервюта, телевизионни записи, архиви или записи на екрани, без задължително първо да ги прекарват през отделна система за транскрипция.

Според Alibaba цената на час аудио вход при новия модел е с над 98% по-ниска от тази при Qwen3.5-Omni-Plus. Независими изчисления върху публикуваните тарифи поставят стойността около 0,004 долара за час аудио вход, макар крайната цена на конкретна задача да зависи и от останалия вход, генерирания текст и използваните инструменти.

Qwen3.8-Omni-Flash вече се предлага през Alibaba Cloud Model Studio. Документацията посочва поддръжка в центрове за данни в Пекин, Сингапур, Хонконг, Токио, Франкфурт и Вирджиния.