Alibaba lansează Qwen3.8-Flash-Next: un preview pentru viitoarea arhitectură Qwen4
Cum transformă arhitectura hibridă ecosistemul NVIDIA GB300!
Alibaba Cloud a făcut un pas important pentru comunitatea de developeri, lansând „greutățile” (weights) modelului Qwen3.8-Flash-Next. Această lansare timpurie oferă o privire în culisele viitoarei arhitecturi Qwen4, permițând programatorilor să testeze sistemul chiar acum. Scopul principal? Colectarea de feedback valoros înainte de lansarea oficială. Modelul este optimizat special pentru sarcini complexe de programare asistată de AI și promite o eficiență remarcabilă pe hardware-ul modern.
Știri de Ultimă Oră
Massie acuză Black și Copperfield de conspirație cu Epstein
Mandatul de etanol a scumpit masa indiană: impactul neașteptat asupra bugetelor
Criza apei la Gaza se agravează după distrugerea stației de dezsalinare
Pakistan trebuie să declare starea de urgență pentru femicid după uciderea brută a jurnalistei Hina JavedCompania a construit acest model ca un sistem multimodal de tip „mixture-of-experts”. Structura sa este impresionantă: 125 de miliarde de parametri pentru nucleul principal, la care se adaugă 51 de miliarde dedicați pentru embedding-uri N-gram. Cu toate acestea, ingeniozitatea designului constă în faptul că modelul activează doar șase miliarde de parametri per token. Această abordare asigură o viteză de inferență ridicată fără a sacrifica precizia. Mai mult, arhitectura suportă o fereastră de context nativă de 262.144 de tokeni, permițând procesarea unor documente sau baze de cod masive dintr-o singură rulare.
Pentru rezultate optime, dezvoltatorii sunt încurajați să utilizeze sistemele NVIDIA GB300 NVL72. Această configurație hardware oferă lățime de bandă ridicată și latență scăzută, elemente critice pentru fluxurile de lucru complexe. Modelul, prin natura sa de activare rară, se integrează natural cu această infrastructură, facilitând iterații rapide în dezvoltarea asistenților de codare. Echipele pot implementa acești agenți în medii de lucru în timp real, reducând considerabil costurile de calcul.
Orientarea către „agentic coding” marchează o schimbare de paradigmă în AI. Spre deosebire de modelele tradiționale, care se pot bloca în sarcini cu mai mulți pași, Qwen3.8-Flash-Next menține coerența pe secvențe lungi de interacțiune.
Capacitățile multimodale și transparența codului deschis permit adaptarea modelului la nevoile specifice ale fiecărei industrii, scăzând barierele de intrare pentru instrumentele AI avansate.
Strategia „mixture-of-experts” este cheia agilității acestui model
Strategia „mixture-of-experts” este cheia agilității acestui model.
În timp ce modelele dense consumă resurse pentru fiecare parametru, Qwen3.8-Flash-Next rămâne sprinten, activând doar o fracțiune din rețea. Cele 6 miliarde de parametri activi mențin consumul de resurse sub control, facilitând rularea mai multor instanțe simultan. Stratul de embedding N-gram preia sarcina tiparelor repetitive din cod, degrevând astfel straturile principale și asigurând o scalabilitate excelentă.
Care este numărul total de parametri? Modelul totalizează 176 de miliarde de parametri (125B baza + 51B embedding-uri), însă activează doar 6 miliarde per token.
Ce hardware este recomandat? Sistemele NVIDIA GB300 NVL72 sunt ideale, profitând de lățimea de bandă superioară, deși modelul poate rula și pe alte clustere GPU de înaltă performanță.
Este disponibil pentru uz comercial? În prezent, greutățile sunt oferite pentru experimentare și evaluare, fiind un preview pentru Qwen4. Condițiile licenței comerciale vor fi anunțate ulterior.