Interconnexió òptica d'alta velocitat: solucions de centre de dades

Apr 27, 2026|

El trimestre passat vam tenir un client que va tornar a enviar quaranta mòduls 400G DR4 que reclamaven solapes d'enllaç aleatoris als seus commutadors Arista 7060X5. Abans fins i tot d'obrir la documentació RMA, el nostre enginyer de proves va fer una pregunta: heu inspeccionat elConnectors MPOabans de la instal·lació? No ho tenien. Hem enviat els mòduls a través de la nostra regressió completa, diagrames d'ulls nets, BER per sota d'1E-13 als quatre carrils,Lectures DDM nominals. Aleshores, els vam demanar que ens enviessin fotos de les cares de l'extrem-del cable del tronc sota un microscopi de fibra. Cada connector tenia contaminació per partícules. Quaranta mòduls, zero defectes. El problema era la pols.

 

Veiem alguna versió d'això cada mes. Els desplegaments d'interconnexió òptica d'alta velocitat a qualsevol escala toquen el mateix mur, i els números ho donen suport: entre el 65% i el 70% de tots els errors d'enllaç 400G i 800G es remunten a la contaminació del connector, no a fallades del transceptor. (Dades de camp IEEE 802.3 mitjançant AscentOptics) Apuntem això primer perquè emmarca com pensem sobre tota la decisió d'interconnexió. El mòdul gairebé mai és l'enllaç més feble. La capa física que l'envolta és.

Microscopic view of an MPO fiber optic connector end-face showing severe dust and particulate contamination on the four precision glass cores of a 400G module, illustrating the number one cause of link failure.

 

El vostre patró de trànsit decideix la vostra arquitectura d'interconnexió òptica

 

Tothom comença amb el número de peça.QSFP-DD o OSFP, SR o DR, multimode o mode{0}}únic. Nosaltres també ho fem. Però els desplegaments que van anar bé per als nostres clients van començar en un altre lloc: com és realment el trànsit?

L'entrenament en IA-a gran escala genera una comunicació de-a-tota la GPU que resulta ser sorprenentment previsible en escales de temps de minuts a hores. Google ho aprofita amb commutadors de circuits òptics a la seva xarxa de Júpiter, reconfigurant camins de llum físics entre bastidors en lloc de canviar paquets. Els seus resultats publicats d'una dècada d'ús de la producció: un 41% de reducció de potència, un 30% de capex inferior i una millora de 50 vegades en el temps de funcionament del teixit en comparació amb la seva arquitectura Clos anterior. (Google SIGCOMM'22) Aquestes xifres són reals, però pertanyen a una empresa que va gastar entre 500 i 1.000 milions de dòlars en infraestructura OCS durant cinc anys. Hem tingut un grapat de clients de mida mitjana-ens demanen que avaluem la viabilitat d'OCS per als seus entorns. En tots els casos, una vegada que van executar els números a una escala inferior a-500 nodes, els requisits de capital van superar els avantatges de la reconfiguració i es van mantenir amb la columna vertebral convencional mitjançant mòduls connectables.

La inferència capgira l'equació. El trànsit és intens i impredictible a nivell de flux, i la tolerància a la latència és propera a zero. No podeu reconfigurar els camins òptics per-sol·licitud. El que necessiteu és un teixit de sobreprovisionament constant amb latència determinista, que us empeny cap a transceptors connectables en una topologia de fulla-espina on tots els enllaços estiguin sempre il·luminats. Venem mòduls en ambdós escenaris, i les converses d'enginyeria són completament diferents. Els compradors de clúster de formació volen saber sobre l'amplada de banda agregada per bastidor i la potència per bit. Els compradors d'inferència pregunten sobre la latència de la cua i què passa quan un enllaç cau.

 

Conceptual architectural diagram of a data center network topology comparing a custom Optical Circuit Switch (OCS) fabric for long-running AI training jobs versus a standard non-blocking Spine-Leaf topology for bursty inference workloads.

 

Per als entorns empresarials i de colors tradicionals per sota de la hiperescala, el cost per port domina i la compatibilitat amb les instal·lacions de fibra existents és més important que la densitat d'ample de banda en brut. Hem provat el nostreMòduls QSFP-DD 400G en 14 plataformes de commutacióincloent Cisco Nexus 93600CD, Arista 7060X5 i Juniper QFX5220. En aquests entorns, la preocupació dominant no és la velocitat. És si el mòdul és reconegut pel microprogramari del commutador sense ordres d'anul·lació manual.

 

La zona morta de 800G que atrapa els enginyers desprevinguts

 

A 400 G, escollir una interconnexió era un procés de dos-passos: mesurar la distància, triar coure o fibra. El DAC passiu va cobrir còmodament entre 3 i 5 metres. 800G ho va trencar. Cada carril funciona amb 112G PAM4. La pèrdua de coure a aquestes freqüències es duplica aproximadament en comparació amb els 400G, i el resultat és un sostre dur d'uns 2 metres per al cable passiu.

 

High-speed cable comparison showing an Active Electrical Cable (AEC) vs a standard Direct Attach Copper (DAC) bundle. The AEC uses internal retimers to extend the 800G signal reach to 7 meters at the cost of slight latency overhead.

 

Ho vam aprendre de manera cara. Un client primerenc va demanar el nostreConjunts DAC passius 800Gen longituds de 3 metres segons la seva disposició de bastidor de 400 G. La formació d'enllaços ha fallat en més del 60% dels ports. El coure no era defectuós; la física simplement no ho permetria. Es van canviar a AEC per als recorreguts de 3 a 5 metres i mòduls òptics connectables per a tot el que hi ha més enllà, i el desplegament es va estabilitzar en una setmana. Des de llavors, hem deixat de rebre comandes de 800G DAC passiu per sobre de 2,5 metres i hem afegit un avís de distància de desplegament al nostre procés de confirmació de la comanda.

 

AEC ara és propietari de la bretxa de 3 a 7 metres. Els retemporitzadors digitals regeneren el senyal elèctricament sense conversió òptica, la qual cosa redueix el cost però afegeix latència. Només el KP4 FEC posa de 50 a 100 nanosegons a cada salt a 800 G, i el retimer s'apila més a la part superior. Hem mesurat la latència afegida total entre 85 i 110 ns als conjunts AEC que enviem actualment. Per als enllaços de teixit de fulles-espinades, aquesta sobrecàrrega és invisible en el rendiment de l'aplicació. Per als clústers de GPU estretament acoblats, és una història diferent. A partir de les dades de perfil de tres desplegaments de clients que executen nodes H100, si la sobrecàrrega de comunicació del vostre treball d'entrenament ja supera el 15%, aquests cent nanosegons addicionals per salt a través de diversos nivells de commutació es comencen a augmentar a les operacions NCCL AllReduce.

 

Més enllà dels 7 metres, els transceptors òptics connectables per a 800G són l'únic camí viable. Les exigències de la capa física s'estrenyen considerablement aquí. Els pressupostos de pèrdua d'inserció d'extrem--extrem a IEEE 802.3ck aterren per sota d'1,5 dB per a la majoria de classes d'abast 800G, i cada connexió MPO aparellada ha de romandre per sota de 0,35 dB. Hem vist que la fibra instal·lada que va passar la certificació a 100G mostra valors PMD dues o tres vegades per sobre de la seva especificació nominal després de diversos anys de compressió a les safates de cables, d'acord amb el que l'equip d'investigació de la xarxa de Juniper va informar el 2023. La nostra recomanació estàndard abans de qualsevol desplegament de transceptor 800G: executar la caracterització OTDR i PMD a cada segment de fibra existent. No és una mostra. Cada segment. El cost de tornar a-treure dos cables troncals és una fracció del cost de depurar solapes d'enllaç intermitent durant sis mesos.

 

CPO vs LPO vs Pluggable: on es troba realment cada tecnologia el 2026

 

L'òptica conjunta{0} canviarà la manera com es construeix la infraestructura de commutació del centre de dades. Ho diem com a fabricant de mòduls connectables, així que considerem la nostra opinió com a informada en lloc de neutral.

 

A l'OFC 2026, les dades de fiabilitat dels prototips CPO van mostrar taxes de fallada potencialment inferiors a les dels mòduls connectables tradicionals. Sense cicles d'inserció mecànica o superfícies de connector exposades, els modes de fallada dominants dels mòduls connectables simplement no s'apliquen. La plataforma de commutació Bailly 51.2T CPO de Broadcom va demostrar un consum d'energia aproximadament un 70% inferior a la capa òptica en comparació amb configuracions connectables equivalents. (Informe d'interconnexió òptica de DataMIIntelligence) NVIDIA va mostrar commutadors integrats de CPO-a GTC 2026 amb l'objectiu d'augmentar el desplegament-entre 2027 i 2028.

 

La nostra posició: si no sou un hiperescalador que construeix un commutador de silici personalitzat, l'òptica connectable és la vostra única opció desplegable almenys fins al 2027. CPO necessita arquitectures de placa que la majoria de proveïdors de commutadors encara no s'han enviat, estàndards de connectors que no s'han finalitzat i un llibre de jocs completament nou per gestionar els errors que no podeu solucionar tirant d'un mòdul. L'ecosistema per a la compra general de l'empresa encara no existeix. Durant l'últim any, dos clients potencials han retardat les seves actualitzacions de 400G-a 800G a l'espera del CPO. Tots dos finalment van tornar i van fer comandes connectables després que els seus buits d'ample de banda es convertís en incidents de producció. Vam escriure sobre la justificació d'enginyeria d'aquesta posició amb més detall al nostreAnàlisi de l'arquitectura del transceptor connectable.

 

LPO es troba en un espai diferent. Si elimineu el DSP del mòdul, s'elimina el component-que consumeix més energia, responsable de fins a la meitat del consum total d'energia del mòdul. El resultat és un consum inferior entre un 30 i un 50% i una latència de fins a 15 nanosegons menys. Vam començar a enviar RFQ específiques de LPO-a finals de 2025. Tres dels quatre provenien de clients que construïen clústers de GPU d'un sol-provedor a NVIDIA Spectrum-X. Cap operava teixits de diversos-proveïdors, que us diuen tot sobre on treballa LPO avui dia. Si la vostra xarxa barreja proveïdors de commutació, LPO no és compatible amb el vostre entorn. Si executeu un sol-clúster d'IA d'un proveïdor, pot ser que sigui l'actualització més intel·ligent disponible, i esperem tenir mòduls preparats per a LPO-qualificació a mitjans de 2027.

Què signifiquen els marges tèrmics de 800G per a la selecció de mòduls

 

Les matemàtiques tèrmiques a 800 G agafa la gent desprevinguda. La densitat de potència d'interconnexió òptica d'alta velocitat en aquesta generació crea problemes que simplement no existien a 400G. Un commutador de 64 ports completament carregat amb mòduls de 800 G a 16 W cadascun consumeix aproximadament 1 kW de potència del transceptor només, abans que el commutador ASIC de 400 a 500 W. Això és d'1,4 a 1,5 kW per interruptor. Vuit interruptors en una capa de columna us permeten més d'11 kW només des dels equips de xarxa, en bastidors que sovint s'aprovisionaven per a un total de 8 a 10 kW.

 

Juniper Networks adverteix explícitament que els mòduls de tercers-amb un consum elevat d'energia, especialment els tipus ZR i ZR+ coherents, poden causar danys tèrmics a l'equip amfitrió, i la responsabilitat recau en l'usuari. (Preguntes freqüents sobre Juniper Networks 800G Optics) Això no és un argument contra els mòduls òptics de tercers-. És un argument per saber exactament què esteu connectant. A la nostra qualificació de ciclisme tèrmic, provem el disseny de cada mòdul de 800G a una temperatura d'unió sostinguda de 85 graus durant 2.000 hores i fem un seguiment de la deriva del corrent de polarització làser com a indicador principal d'envelliment. Les unitats que es desplacen per sobre de 38 mA es treuen de la línia de producció. A densitats de 800 G, la diferència entre un mòdul que dibuixa 14 W i un dibuix de 18 W determina si un bastidor es manté dins de l'embolcall tèrmic o activa alarmes d'apagada a les 2 del matí. Equivocar les especificacions sempre ha estat molest. En aquests nivells de potència, és car.

Thermal heatmap of a high-density switch rack illustrating extreme heat concentration in the transceiver cage area where 64 modules drawing 16W each generate significant thermal load, nearing cooling capacity limits.

 

 

Enviem mòduls connectables des de 1G SFP fins a 800G OSFP, i fem proves amb les principals plataformes de commutació. Mantenim registres del que funciona i del que no. Si necessiteu una comprovació de compatibilitat amb un entorn de commutació específic, o voleu especificacions de classe-tèrmica i potència per a bastidors de 800G d'alta-densitat, els nostres enginyers fan aquestes converses cada setmana. El nostrePàgina del transceptor 800G OSFP i QSFP-DD800té especificacions, opcions d'abast-classe i formularis de sol·licitud de mostra per a cada mòdul que enviem.

Send Inquiry