Știri Proaspete

Alibaba lansează Qwen3.8-Flash-Next: un preview pentru viitoarea arhitectură Qwen4

De Ioana Petrescu · 02.09.2026

Cum transformă arhitectura hibridă ecosistemul NVIDIA GB300!

Alibaba Cloud a făcut un pas important pentru comunitatea de developeri, lansând „greutățile” (weights) modelului Qwen3.8-Flash-Next. Această lansare timpurie oferă o privire în culisele viitoarei arhitecturi Qwen4, permițând programatorilor să testeze sistemul chiar acum. Scopul principal? Colectarea de feedback valoros înainte de lansarea oficială. Modelul este optimizat special pentru sarcini complexe de programare asistată de AI și promite o eficiență remarcabilă pe hardware-ul modern.

Compania a construit acest model ca un sistem multimodal de tip „mixture-of-experts”. Structura sa este impresionantă: 125 de miliarde de parametri pentru nucleul principal, la care se adaugă 51 de miliarde dedicați pentru embedding-uri N-gram. Cu toate acestea, ingeniozitatea designului constă în faptul că modelul activează doar șase miliarde de parametri per token. Această abordare asigură o viteză de inferență ridicată fără a sacrifica precizia. Mai mult, arhitectura suportă o fereastră de context nativă de 262.144 de tokeni, permițând procesarea unor documente sau baze de cod masive dintr-o singură rulare.

Pentru rezultate optime, dezvoltatorii sunt încurajați să utilizeze sistemele NVIDIA GB300 NVL72. Această configurație hardware oferă lățime de bandă ridicată și latență scăzută, elemente critice pentru fluxurile de lucru complexe. Modelul, prin natura sa de activare rară, se integrează natural cu această infrastructură, facilitând iterații rapide în dezvoltarea asistenților de codare. Echipele pot implementa acești agenți în medii de lucru în timp real, reducând considerabil costurile de calcul.

Orientarea către „agentic coding” marchează o schimbare de paradigmă în AI. Spre deosebire de modelele tradiționale, care se pot bloca în sarcini cu mai mulți pași, Qwen3.8-Flash-Next menține coerența pe secvențe lungi de interacțiune.

Capacitățile multimodale și transparența codului deschis permit adaptarea modelului la nevoile specifice ale fiecărei industrii, scăzând barierele de intrare pentru instrumentele AI avansate.

Strategia „mixture-of-experts” este cheia agilității acestui model

Strategia „mixture-of-experts” este cheia agilității acestui model.

În timp ce modelele dense consumă resurse pentru fiecare parametru, Qwen3.8-Flash-Next rămâne sprinten, activând doar o fracțiune din rețea. Cele 6 miliarde de parametri activi mențin consumul de resurse sub control, facilitând rularea mai multor instanțe simultan. Stratul de embedding N-gram preia sarcina tiparelor repetitive din cod, degrevând astfel straturile principale și asigurând o scalabilitate excelentă.

Care este numărul total de parametri? Modelul totalizează 176 de miliarde de parametri (125B baza + 51B embedding-uri), însă activează doar 6 miliarde per token.

Ce hardware este recomandat? Sistemele NVIDIA GB300 NVL72 sunt ideale, profitând de lățimea de bandă superioară, deși modelul poate rula și pe alte clustere GPU de înaltă performanță.

Este disponibil pentru uz comercial? În prezent, greutățile sunt oferite pentru experimentare și evaluare, fiind un preview pentru Qwen4. Condițiile licenței comerciale vor fi anunțate ulterior.