În era supercomputerelor AI cu sute de mii de GPU-uri, performanța nu mai depinde doar de procesoare. Rețeaua care le conectează devine o componentă critică a întregului sistem. Multipath Reliable Connection (MRC) propune o nouă abordare pentru Ethernet, construită în jurul scalabilității, rezilienței și interoperabilității.

Există un moment în dezvoltarea oricărei tehnologii când o problemă de inginerie devine o problemă de industrie. Pentru infrastructura AI, acel moment a venit odată cu apariția clusterelor capabile să conecteze zeci sau chiar sute de mii de GPU-uri.
La această scară, rețeaua nu mai este doar infrastructura care transportă date între servere. Ea devine parte din mecanismul care determină cât de eficient poate funcționa întregul supercomputer. O congestie temporară, o rută indisponibilă sau defectarea unei componente poate afecta procese de antrenare care rulează sincronizat pe mii de acceleratoare.
Din această nevoie s-a născut Multipath Reliable Connection, sau MRC.
O idee născută dintr-o nevoie urgentă
Povestea MRC începe la sfârșitul anului 2023, când ritmul de dezvoltare a infrastructurii AI a început să depășească posibilitățile arhitecturilor tradiționale de networking.
OpenAI, AMD, Broadcom și Intel au început să exploreze împreună o soluție care să poată fi dezvoltată și implementată într-un timp suficient de scurt pentru ritmul accelerat al industriei.
Primele întâlniri tehnice au avut loc la începutul lui 2024. Direcția era ambițioasă, dar pragmatică: nu construirea unui nou ecosistem de networking de la zero, ci extinderea unor tehnologii deja validate.
MRC a fost conceput ca un transport deschis pentru Ethernet, capabil să gestioneze mai eficient traficul în infrastructurile AI de mari dimensiuni. Printre mecanismele urmărite s-au numărat multipathing-ul, controlul avansat al congestiei, selective acknowledgments, plasarea pachetelor out-of-order și packet trimming.
Rezultatul a fost primul draft al specificației, elaborat în doar câteva luni printr-un proces de întâlniri tehnice săptămânale și iterații rapide.
Nu un nou stack, ci o evoluție a Ethernetului
Una dintre deciziile importante din dezvoltarea MRC a fost aceea de a porni de la tehnologii existente.
În loc să abandoneze infrastructura RoCE și să creeze o arhitectură complet nouă, colaboratorii au urmărit extinderea transportului existent, în paralel cu valorificarea inovațiilor dezvoltate în cadrul Ultra Ethernet Consortium.
Această strategie are o implicație majoră: MRC nu încearcă să reinventeze Ethernetul, ci să-l adapteze pentru realitatea clusterelor AI moderne.
Pe măsură ce proiectul a evoluat, au intrat în discuție și cerințe provenite direct din infrastructurile hyperscale. Microsoft a contribuit cu experiență și feedback privind implementarea la scară foarte mare, în timp ce producătorii de silicon au participat la rafinarea arhitecturii și a interfețelor software.
Una dintre schimbările semnificative a fost trecerea de la utilizarea unor Entropy Values pentru programarea rutelor la o abordare bazată pe SRv6. În paralel, MRC a rămas aliniat cu evoluția specificațiilor UEC, utilizând UEC UET 1.0 pentru capabilitățile fundamentale de transport și extinzându-le acolo unde cerințele AI au impus acest lucru.
Standardizarea software devine la fel de importantă ca hardware-ul
Într-un ecosistem multi-vendor, interoperabilitatea nu poate fi rezolvată doar la nivelul hardware-ului.
Broadcom a susținut, de aceea, dezvoltarea unei interfețe software comune în jurul MRC. Inițiativa a inclus extensii standardizate pentru verbe și API-uri pentru controllere, cu obiectivul de a permite dezvoltarea unor aplicații software portabile între implementări diferite.
Este un detaliu tehnic cu implicații importante. Dacă un cluster AI trebuie să combine componente de la mai mulți furnizori, standardizarea interfețelor poate reduce dependența de implementări proprietare și poate simplifica dezvoltarea și operarea infrastructurii.
De la whiteboard la supercomputere
Poate cel mai relevant aspect al poveștii MRC este viteza cu care specificația a trecut de la concept la implementare.
Broadcom a urmărit încă de la început integrarea MRC în produse comerciale. Suportul este disponibil în portofoliul său de networking pentru AI, inclusiv în switch-urile Tomahawk 5 și Tomahawk 6 și în Thor Ultra Ethernet NIC.
Aceste platforme oferă suport pentru mecanismele care stau la baza MRC: multipath forwarding, gestionarea avansată a congestiei, plasarea pachetelor în afara ordinii, packet trimming și forwarding bazat pe SRv6.
Dar adevărata validare vine din infrastructura de producție.
Conform informațiilor publicate de OpenAI, MRC este deja utilizat în unele dintre cele mai mari supercomputere AI ale companiei, inclusiv în infrastructurile Abilene ale Oracle Cloud Infrastructure și Fairwater ale Microsoft. Aceste sisteme au fost utilizate pentru antrenarea unor modele AI de ultimă generație și includ soluții de networking de la Broadcom și NVIDIA.
Următoarea etapă este mai importantă decât prima
Contribuția MRC către Open Compute Project marchează o schimbare de etapă. Proiectul nu mai aparține doar grupului inițial de companii care l-au conceput. Specificația intră într-un cadru în care poate fi analizată, modificată și extinsă de o comunitate mai largă.
Iar acest lucru poate fi esențial pentru viitorul infrastructurii AI.
Pe măsură ce modelele devin mai mari, iar clusterele de acceleratoare continuă să crească, rețelele vor trebui să ofere simultan performanță, predictibilitate și reziliență. Într-un sistem cu sute de mii de GPU-uri, eliminarea unui singur punct de congestie sau reducerea impactului unei defecțiuni poate avea consecințe directe asupra eficienței întregului supercomputer.

MRC, mai mult decât o nouă specificație de transport.
Este un exemplu despre cum industria încearcă să răspundă uneia dintre cele mai dificile probleme ale erei AI: cum transformi Ethernetul într-o infrastructură suficient de inteligentă și rezilientă pentru a conecta următoarea generație de supercomputere.
Prima etapă a MRC s-a încheiat odată cu publicarea și adoptarea specificației deschise. Următoarea se va scrie în ecosistemul OCP — acolo unde succesul său va depinde nu doar de performanța tehnologiei, ci și de capacitatea industriei de a construi în jurul ei un standard cu adevărat interoperabil.
SolvIT Networks este partener strategic pentru Europa Centrală și de Est al Broadcom.



























