Conform Playtech.ro: Nvidia revoluționează procesarea inteligenței artificiale cu o nouă abordare arhitecturală, care promite o eficiență energetică sporită și performanțe îmbunătățite. Denumită „Groq 3 LPX”, această tehnologie se îndepărtează de mecanismele tradiționale ale procesoarelor, precum predicția ramificațiilor, cache-urile sau execuția out-of-order. În schimb, compilatorul joacă un rol central, stabilind aproape fiecare operațiune, inclusiv sincronizarea ciclurilor de ceas.
Această planificare meticuloasă permite anticiparea consumului electric. Sistemul poate pregăti alimentarea pentru diverse zone ale cipului înainte ca acestea să solicite energie, diminuând variațiile de tensiune. Nvidia susține că această tehnologie poate reduce fenomenul de „voltage droop” cu peste 60% și depășirile de tensiune cu peste 70%.
Controlul predictibil al sarcinilor contribuie, de asemenea, la gestionarea termică a cipurilor. În loc ca performanța generală să fie limitată de cea mai fierbinte componentă, sarcinile pot fi redistribuite pentru o disipare mai uniformă a căldurii. Nvidia estimează că această metodă ar putea genera o performanță suplimentară de 10-11% în condițiile aceluiași buget termic.
Groq 3 lpx, partenerul gpu-urilor vera rubin
Noua arhitectură Groq 3 LPX nu este poziționată ca un înlocuitor pentru unitățile de procesare grafică (GPU) Nvidia. Compania adoptă o strategie de colaborare, împărțind procesarea modelelor de inteligență artificială între două tipuri de hardware.
GPU-urile din platforma Vera Rubin NVL72 ar urma să se ocupe de etapa de „prefill”, o fază care necesită o putere de calcul imensă și o capacitate mare de memorie. Ulterior, procesoarele LP30 ar prelua sarcina de „decode”, responsabilă cu generarea efectivă a răspunsului.
Diferența majoră de memorie explică această diviziune. Un GPU Rubin dispune de aproximativ 288 GB de memorie HBM4, o cantitate incomparabil mai mare decât cei aproximativ 500 MB de SRAM ai unui cip LP30. Pentru modele AI extrem de mari, capacitatea memoriei devine rapid o limitare pentru arhitectura Groq.
Provocările modelelor masive de inteligență artificială
În scenariul unui model de 31 de miliarde de parametri în format FP8, ar fi necesare aproximativ 62 de procesoare LP30 doar pentru stocarea parametrilor. În cazul modelelor Mixture-of-Experts, care pot ajunge la trilioane de parametri, numărul de cipuri necesare poate escalada la mii, necesitând distribuirea lor pe mai multe rack-uri de servere.
Această arhitectură, prin optimizarea ciclurilor de ceas și a fluxului de date, vizează reducerea latenței și creșterea eficienței în procesarea modelelor complexe de inteligență artificială. Integrarea cu GPU-urile existente subliniază intenția Nvidia de a maximiza performanța prin utilizarea specifică a fiecărui tip de hardware.
Sursa: Playtech.ro