Çfarë është një Qendër e të Dhënave të IA-së?

Çfarë është një Qendër e të Dhënave të IA-së? [Video dhe Kuiz]

Përgjigje e shkurtër: Një qendër të dhënash e inteligjencës artificiale është një me dendësi të lartë ku energjia, ftohja, struktura dhe ruajtja përqendrohen rreth modeleve të trajnimit dhe shërbimit, jo një dhome serverash me GPU shtesë. Çipat marrin famën; ndërtesa vendos nëse ato funksionojnë. Nëse imazhet nuk mund të largohen, rimodeloni një qelizë të vogël; shumica e ekipeve duhet të marrin me qira.

Përmbledhjet kryesore:

Çipat kundrejt ndërtimit: Energjia, ftohja, pëlhura dhe ruajtja e energjisë përcaktojnë nëse përshpejtuesit funksionojnë apo jo.

Vende jo pallate: Riparoni dy rafte kur të dhënat nuk mund të largohen; mos blini një kampus.

Mesatarja kundrejt medianës: Në tetë vrapime, mediana rinis; përdorni mesataren 18-orëshe.

Rezistencë ndaj keqpërdorimit: Mos jepni kuotën e një PUE për dy rafte në një sallë të përzier.

Rezultate ilustruese: Tetë vrapime janë një hartë e vogël, jo një kursim prej 50% prodhimi.

Artikuj që mund t'ju pëlqejnë të lexoni pas këtij:

🔗 A është inteligjenca artificiale e besueshme? Video dhe kuiz.
Eksploroni besueshmërinë e inteligjencës artificiale përmes një videoje tërheqëse dhe një kuizi interaktiv.

🔗 Si ta përdorni IA-në në jetën e përditshme
Zbuloni mënyra praktike se si IA mund të thjeshtojë detyrat dhe rutinat e përditshme.

🔗 Si ta përdorni inteligjencën artificiale në punë.
Mësoni mënyra praktike për të përdorur inteligjencën artificiale për produktivitet më të zgjuar në vendin e punës.

🔗 A mund të mendojë vetë inteligjenca artificiale?
Kuptoni nëse inteligjenca artificiale mund të mendojë vërtet në mënyrë të pavarur ose të arsyetojë.

Si ndryshon nga një qendër të dhënash "normale"

Sallat tradicionale optimizohen për ngarkesa të përziera pune dhe kohëzgjatje funksionimi në shumë shërbime të vogla. Ju interesohet redundanca, sigurisht, dhe PUE si koncept - energjia shtesë që ndërtesa djeg për të ofruar një vat fuqi llogaritëse. Zakonisht nuk e projektoni çdo korridor rreth një rafti që sillet si një fermë ngrohëse portative.

Faqet e inteligjencës artificiale i ndryshojnë raportet. Dendësia rritet. Rrjeti bëhet një strukturë pa të cilën puna e trajnimit nuk mund të ecë ngadalë. Magazinimi duhet t'i mbajë pikat e kontrollit në lëvizje ose përshpejtuesit qëndrojnë të palëvizshëm, si kuajt e garave në një bllokim trafiku.

Ekziston edhe një ndryshim kulturor. Operatorët e ndërmarrjeve mendojnë për biletat dhe dritaret e ndërrimit. Operatorët e inteligjencës artificiale mendojnë për radhët e punës dhe ndjenjën e keqe kur një nyje vdes vonë në një periudhë afatgjatë. Mendoj se prapë mund t'i quani të dyja "qendra të dhënash" sepse janë. Etiketa thjesht fsheh problemin.

Lloji Për çfarë është ndërtuar Pajisje të spikatura Karakteri i fuqisë / ftohjes Kujt i përshtatet Pse ekziston
Qendra tradicionale e të dhënave të ndërmarrjeve IT e përzier: baza të dhënash, makina virtuale, email, skedarë CPU-të, serverët e zakonshëm, ruajtja e të dhënave e njohur Me ajër të udhëhequr; dendësi modeste; PUE si pikë diskutimi Kompanitë që drejtojnë sisteme të përditshme Mbani aplikacionet e biznesit të ndezura
Klasteri i trajnimit të inteligjencës artificiale Punë trajnimi të gjata dhe të lidhura ngushtë Rafte përshpejtuesish të dendura; Ndërlidhje GPU Dendësi e lartë; ftohje me lëng ose [shkëmbyes nxehtësie në derën e pasme] (https://datacenters.lbl.gov/sites/default/files/rdhx-doe-femp.pdf) Laboratorët dhe ndërtuesit e modeleve që jetojnë në radhë pune Përfundo vrapimin pa humbur patate të skuqura
Pajisje për nxjerrjen e përfundimeve nga inteligjenca artificiale Shërbim modeli; përgjigje në kohë reale dhe në grup Përshpejtuesit; balancuesit e ngarkesës që kanë rëndësi Ende i nxehtë, thjesht... më pak teatral; vonesë mbi dendësinë brutale Produkte që duhet të përgjigjen tani Vendoseni modelin pranë përdoruesit
Salla hibride e inteligjencës artificiale Stërvitje dhe shërbim nën një çati; pak a shumë Rafte të përziera; pishina të rrethuara; pëlhurë e përbashkët Dy personalitete tërheqëse në një dhomë bimësh; bëhet e sikletshme Ekipet që nuk mund të përballojnë dy kampuse Kapitali është i kufizuar; jeta është e çrregullt

Jo një renditje morale. Makina të ndryshme, i njëjti mbiemër.

GPU-të, përshpejtuesit dhe rafti që konsumon energji

Ecni në një dysheme të ngritur tradicionale dhe raftet duken pothuajse të sjellshme. Ecni në një rresht me AI dhe ato duken sikur duan ta gëlltisin ndërtesën.

Pajisjet që spikasin nuk janë një CPU e zgjuar. Është tabaka e përshpejtuesit: GPU-të ose çipa të tjerë të inteligjencës artificiale, të paketuar në servera, pastaj rafte, pastaj rreshta që ndajnë një strukturë me gjerësi të lartë bande. GPU-ja ndërlidh çipat e qepur në diçka që mund të pretendojë të jetë një përshpejtues gjigant; struktura e grumbullit bën të njëjtën gjë në shkallë rreshti. Trajnimi paralel funksionon vetëm nëse këto lidhje mbeten të trasha dhe të parashikueshme. Nëse e humbni këtë, "grupi" juaj do të jetë një grumbull stacionesh pune të shtrenjta që ndajnë të njëjtin kod postar.

Fuqia vjen pas çipave. Jo një PDU zyre e madhe. Megavat ngarkesë IT sapo të mbushet një sallë - nuk do të shpik një numër. Dendësia për rack është kthesa e ngjarjes. Më pak rack. Secili prej tyre një furrë e vogël. Faktori kufizues është shpesh nënstacioni, jo lista e dëshirave të GPU-ve. E dini si është: prokurimi dëshiron më shumë përshpejtues; shërbimi publik dëshiron një bisedë të gjatë dhe një çek shumë të madh.

Një metaforë paksa e çuditshme që nuk mund ta heq qafe: kafsha e uritur është një kafshë e uritur. Mund të rritësh një më të shpejtë. Prapë duhet ta ushqesh dhe prapë duhet ta nxisësh vapën. Nëse e anashkalon njërën prej tyre, bëhet një peshë letre shumë e kushtueshme.

Problemi i energjisë, nxehtësisë dhe ftohjes

Fut energji elektrike. Fshi nxehtësinë. Kjo është e gjithë feja.

Raftet me dendësi të lartë e largojnë nxehtësinë në një mënyrë që ajri nuk është kërkuar kurrë ta trajtojë. Mund ta shtyni ajrin më fort - shkëmbyesit e nxehtësisë në derën e pasme, korridoret më të nxehta, kontrolli inteligjent - dhe kjo funksionon deri në një pikë. Pastaj shfaqet lëngu:

  • Ftohje direkte në çip

  • Unaza ftohëse që e bëjnë dhomën e impiantit të duket si një punishte kimike

  • Zhytje në disa dizajne, të cilat ende i trembin njerëzit që mendojnë se uji dhe kamerierët nuk duhet të ndajnë të njëjtën fjali

Asgjë nga këto nuk është joshëse. E gjitha është produkt, sepse një përshpejtues që e kthen gazin është një për të cilin e ke paguar tashmë dhe nuk mund ta përdorësh plotësisht.

PUE ende ka rëndësi. Është një raport, jo një personalitet. Operatorët e ndjekin atë sepse çdo vat i shpenzuar për ventilatorë dhe pompa është një vat që nuk shkoi në një GPU. Nuk do të citoj një shifër "tipike"; klima dhe mënyra se si e vizaton kufirin e lëvizin atë, dhe saktësia e rreme është më e keqe se asnjë. Uji gjithashtu qëndron në histori. Disa bimë pinë. Disa gëlltisin. Ftohja me avullim është efikase derisa lumi ose një thatësirë ​​ta bëjë atë politike.

Rrjetëzimi: pse pëlhura ka po aq rëndësi sa çipat

Njerëzit fotografojnë GPU-të. Ata duhet të fotografojnë edhe switch-et.

Trajnimi është një bisedë. Mijëra përshpejtues shkëmbejnë gradiente, parametra, copëza të një modeli, në sinkronizim të ngushtë. Nëse pëlhura lëkundet, e gjithë puna pret në kërcimin më të ngadaltë. Kjo është arsyeja pse sallat e inteligjencës artificiale fiksohen pas rrjetëzimit me gjerësi të lartë bande, vonesës së ulët dhe topologjive që nuk palosen përgjysmë kur një lidhje dështon. Pëlhura të ngjashme me InfiniBand, Ethernet në të njëjtin rol, ndërlidhje GPU brenda kutisë, kabllo që duhet të jenë të sakta herën e parë.

Konkluzionet janë një bisedë tjetër. Shërbimi i modelit interesohet për vonesën e bishtit - përgjigja e ngadaltë, jo ajo mesatare. Shërbimi në grup kundrejt atij në kohë reale ndan personalitetin. Një grumbull trajnimi dëshiron lëvizje të madhe, kolektive, pothuajse të tëra. Një flotë shërbimi dëshiron shumë kërkesa më të vogla dhe izolim, pa bllokim trafiku në balancuesin e ngarkesës.

Humbja, ndërsa unë jam këtu: njerëzit e trajtojnë rrjetin si hidraulik dhe patatet e skuqura si restorant. Në këtë ndërtesë hidrauliku është restoranti. Nëse e humb këtë, blen një kuzhinë që nuk mund të pranojë porosi me porosi.

Trajnimi kundrejt përfundimit: dy ndërtesa, ndonjëherë fjalë për fjalë

Trajnimi është një fushatë. Ju mblidhni një klaster, i jepni të dhëna, kryeni kontrolle me përkushtim, e përdorni për orë ose javë të tëra dhe luteni që rrjeti të mbetet pa ngjarje. I ngarkuar me shumë grupe, i etur për bandwidth, i duruar qetësisht - derisa një nyje e dështuar të humbasë pak nga puna. Një përshpejtues i vdekur në një punë të lidhur fort mund ta bllokojë të gjithë korin.

Inferenca është një vitrinë dyqani. Modele të trajnuara tashmë, tani po u përgjigjen pyetjeve, klasifikojnë imazhe, gjenerojnë tekst. Vonesa ka rëndësi. Një përshpejtues pak më i vjetër pranë klientit mund të mposhtë një përshpejtues joshës që është një kontinent larg.

Pra, merrni një ndarje. Kampuset e trajnimit ndjekin pushtetin, tokën dhe dendësinë. Vendet e nxjerrjes së përfundimeve ndjekin vonesën dhe praninë. Ekzistojnë edhe salla hibride, sepse kapitali nuk është i pafund. Epo - jo gjithmonë dy ndërtesa. Ndonjëherë një sallë me një litar kadifeje dhe dy sythe ftohjeje.

Këtu ndodh edhe bashkë-lokacioni, kampuset hipershkalë dhe platformat e integruara. Hipershkallëzuesit ndërtojnë në shkallë që na bëjnë të dukemi sikur po rregullojmë mobilje. Kolonat shesin dendësi sipas rafteve. Dendësia në ambiente të integruara ndodh akoma kur të dhënat nuk mund të largohen.

Kapaciteti i ruajtjes, pikat e kontrollit dhe çipat e uritur

Askush nuk e vendos sistemin paralel të skedarëve në kopertinën e broshurës.

Të dhënat e trajnimit duhet të mbërrijnë mjaftueshëm shpejt sa GPU-të të mos jenë duke lëvizur me shpejtësi. Pikat e kontrollit duhet të ndodhin në mënyrë që një bllokim të mos humbasë një javë. Peshat e modelit duhet të ngarkohen përpara se një kopje shërbyese të jetë aktive. Kapaciteti i ruajtjes - jo vetëm kapaciteti - është pengesa e qetë. Mund të shpenzoni një pasuri për përshpejtues dhe t'i lini ata pa energji me një grup të sjellshëm të projektuar për makina virtuale.

Modeli është i njohur: një grumbull i shndritshëm, një radhë pune dhe pritje I/O që shikojnë prapa si një faturë e pahijshme. Grumbullimi i llogaritjeve pa grumbulluar rrugën e të dhënave është mënyra se si merrni një punë shumë të kushtueshme në gjendje boshe. Mbani çipat të ushqyer ose pranoni se keni blerë një skulpturë.

Softueri, orkestrimi dhe shtresa jo e bukur e operacioneve

Pajisjet janë personazhi i famshëm. Planifikuesit bëjnë punën.

Një qendër të dhënash e inteligjencës artificiale është e padobishme nëse vendet e punës nuk mund të gjejnë GPU-të, nëse dy ekipe nuk mund të ndajnë një grumbull pa u përleshur me grushte, nëse një gradë e dështuar nuk mund të zëvendësohet, nëse firmware-i devijon derisa pëlhura të dështojë në lëvizje të ngadaltë. Orkestrimi, vëzhgueshmëria, kufizimi i fuqisë - shtresa jo e bukur e operacioneve, e cila është mënyra se si e dini se ka rëndësi.

Unë kam një dobësi për këtë shtresë. Gjithashtu, aty ku një kartë rrjeti e konfiguruar gabim imiton një problem ftohjeje për një pasdite të tërë... e zbulon këtë në mënyrën e vështirë.

Kur një nyje vdes në mes të ekzekutimit

Një nyje vdes. Dritaret e ndryshimit ende përplasen me ekzekutime trajnimi që nuk interesohen për kalendarin tuaj. Ju planifikoni në grup punë të mëdha, rrethoni grupet e nxjerrjes së përfundimeve, shkruani libra ekzekutimi për dështime që duken sikur "puna është e ngadaltë" derisa të duken sikur "puna është e vdekur". Redundanca ende ka rëndësi - energjia, ftohja, shtigjet, ruajtja - por mënyra e dështimit është më pak e rregullt sesa rrëshqitja e vjetër me nëntë minuta kohë funksionimi. Përfundim: kopjim, zbrazni nyjen e sëmurë, vazhdoni të përgjigjeni. Trajnimi kërkon pika kontrolli, jo optimizëm.

Vendndodhja, uji, rrjeti dhe fqinjët

Nuk e lësh një të tillë pranë një vile për pamjen.

Lidhja me rrjetin është shpesh procesi i vërtetë i përzgjedhjes së vendndodhjes. Toka është e lehtë krahasuar me një nënstacion dhe një shërbim që ka klientë të tjerë. Uji për ftohje, nëse e përdorni, bëhet problem për fqinjët sapo reshjet e shiut të jenë të padurueshme. Zhurmë. Sasi vizuale. Nxehtësi në një gardh kufitar. Komitetet e planifikimit zbulojnë mendime rreth "resë" në momentin që ajo ka nevojë për një fushë dhe një lumë.

Latencia tërheq anën tjetër. Inference pëlqen të jetë pranë përdoruesve dhe ndërlidhjeve. Trajnimi mund të fshihet në tregjet më të lira të energjisë dhe klimat më të ftohta. Industria flet sikur të ketë një vend të përsosur. Nuk ka. Ekziston një kompromis me një njoftim për shtyp.

Nxehtësia e mbetur dhe furra e paftuar

Broshurat e adhurojnë këtë pjesë. Ngrohja e mbeturinave hidhet në shtëpi, pishina, serra; është një fjali e bukur. Ndonjëherë unaza e distriktit është e vërtetë. Ndonjëherë kampusi është në vendin e gabuar dhe nxehtësia prapë del në ajër. Jam skeptik ndaj versionit të broshurës; nuk jam skeptik ndaj fizikës.

Kush ka nevojë për një të tillë (dhe kush duhet ta marrë me qira në vend të kësaj)?

Shumica e njerëzve nuk kanë nevojë të kenë një nga këto salla.

Lista e prerë:

  • Hipershkallëzues, sepse produkti është flota

  • Laboratorët, kur koha e radhës është bllokimi, ose të dhënat nuk mund të largohen

  • Një bankë, grup spitalor, qeveri ose prodhues me një grup të dhënash sekrete - në klinikë ose një kafaz privat kolo mund të jetë racional, edhe nëse është një problem

Të gjithë të tjerët duhet të marrin me qira. Bashkëvendosje me dendësi të gatshme për inteligjencë artificiale. Një rezervim në cloud. Një grumbull i menaxhuar. Ju merrni përshpejtuesit pa u bërë edhe operator i termocentralit. Romanca zbehet herën e parë që dikush pyet se kush është në gatishmëri për qarkun e ftohësit në orën 3 të mëngjesit.

Ekziston një çështje krenarie, e pranoj. Të zotërosh një grumbull ndihesh si të zotërosh mjetet e parashikimit. Pastaj mbërrin fatura e energjisë elektrike dhe krenaria ulet.

Për çfarë shërben ndërtesa

Pra, çfarë është një Qendër e të Dhënave të IA-së? Një kampus i specializuar me dendësi të lartë ku përshpejtuesit, energjia, ftohja, struktura dhe ruajtja janë të organizuara rreth modeleve të trajnimit dhe shërbimit - jo IT për qëllime të përgjithshme me një GPU në cep. Duket si një depo. Sillet si një central elektrik që bën llogaritjet.

Nëse nuk mbani mend asgjë tjetër: çipat marrin famë; nënstacioni, ftohësi dhe rrjeti vendosin nëse ato çipa ishin një ide e mirë. Trajnimi dhe nxjerrja e përfundimeve mund të ndajnë të njëjtën çati; ato prapëseprapë duan mënyra të ndryshme. Shumica e organizatave duhet të marrin me qira. Disa duhet të ndërtojnë. Fqinjët do ta vënë re në të dyja rastet.

Reja gjithmonë ka pasur një ndërtesë. Këto ditë ndërtesa ka opinione.

Shembull nga bota reale: Një qelizë trajnimi me dy rafte kur imazhet nuk mund të largohen

Skenari

Tomos është drejtuesi i infrastrukturës në Kestrel Precision, një prodhues me 400 punonjës në West Midlands. Ata tashmë kanë një sallë të vogël në vend: ERP, ndarje skedarësh, makina virtuale, lagjen e përzier me të cilën filloi ky artikull. Ftohje me ajër. Ethernet i zakonshëm. Një SAN që është plotësisht i sjellshëm për disqet e zyrës.

Ekipi i vizionit automatik duhet të trajnojë një model inspektimi në fotografitë e fabrikës. Fotografitë nuk mund të dalin nga vendi. Ato tregojnë një proces që kompania nuk do ta vendosë në një disk cloud, madje as në një disk privat. Zgjidhja e Prokurimit është katër servera me dy përshpejtues dhe një diapozitiv i titulluar "qendra jonë e të dhënave të inteligjencës artificiale". Serverat vendosen në dy rafte ekzistuese, sepse ka hapësirë, dhe hapësira ndihet si kufizim.

Nuk është kështu. Brenda dy javësh, GPU-të tingëllojnë të zëna dhe pastaj ngadalësohen në heshtje. Punët ngadalësohen kur një pikë kontrolli godet SAN-in. Një nyje vdes në orën njëmbëdhjetë dhe puna thjesht... ka mbaruar. Tomos nuk ka munguar të blejë çipa. Ai ka blerë një grumbull stacionesh pune të shtrenjta që ndajnë të njëjtin kod postar. Ndërtesa ishte ende një sallë ndërmarrjeje.

Ata nuk kanë nevojë për një kampus, një nënstacion të ri apo një lumë. Ata kanë nevojë për një qelizë të vogël që sillet si një qendër të dhënash IA në miniaturë: energji që raftet mund të mbajnë, nxehtësi që largohet pa i gatuar çipat, një material për të cilin mund të flasë puna e trajnimit, ruajtje që mund të mbajë një pikë kontrolli dhe një libër për kur një nyje vdes. Meqenëse imazhet nuk mund të largohen, marrja me qira e një kafazi kolo dyzet minuta larg nuk është zgjidhja. Ri-pajisja e dy rafteve është.

Çfarë i duhet qelizës

  • Një buxhet i matur i energjisë në atë rresht, nga PDU-të, jo nga lista e dëshirave të GPU-së. Nëse kapaciteti rezervë nuk mund t'i furnizojë katër serverat me ngarkesë trajnimi, biseda ndalet aty dhe ata duken si një ngjyrë më e dendur, jo një mrekulli

  • Ftohja e ajrit nuk është kërkuar kurrë të bëhet në këtë dendësi: shkëmbyes nxehtësie në derën e pasme nëse korridori mund t'i përballojë, ose një qark i vogël me lëng nëse mund ta përballojë atë. Nëse asnjëra prej tyre nuk funksionon, serverat nuk hyjnë brenda

  • Një rrjet i dedikuar me gjerësi të lartë brezi midis katër nyjeve, jo Ethernet-i i zyrës. Nëse shitësi ka vetëm një switch 10 Gb në katalog, ky nuk është një klaster

  • Ruajtje e shpejtë lokale për pikat e kontrollit dhe copëzat e trajnimit, jo SAN-i i VM-së

  • Një planifikues, një interval kontrolli dhe një shteg i shkruar rinisjeje. Pajisjet janë personazhi kryesor. Kjo shtresë është puna

  • Një kuti inferencash e rrethuar për linjën e fabrikës, e ndarë nga biseda e stërvitjes, sepse shërbimi kërkon vonesë në fund dhe izolim, jo ​​një kolektiv

  • Leje për të regjistruar energjinë, orët e GPU-së, ngjarjet e ngadalësimit dhe orët e punës në mur. Nëse nuk mund t'i inspektojnë ato, do t'i fotografojnë GPU-të dhe do të humbasin çelësat

Shembull udhëzimi

Tomos e shpreh këtë në udhëzimet e përgjithshme të objekteve, me gjuhë të zakonshme:

Mos e quani këtë kampus të inteligjencës artificiale. Ndërtoni një qelizë trajnimi me dy rafte në sallën ekzistuese për katër servera me dy përshpejtues. Imazhet e fabrikës mbeten në vend. Suksesi është: katër nyjet përfundojnë një recetë trajnimi inspektimi-trajnimi 12-epokësh pa frenim termik, shkruajnë një pikë kontrolli brenda minutash jo dhjetëra minutash, dhe rifillojnë nga ajo pikë kontrolli kur të eliminojmë një renditje me qëllim. Ftohja duhet t'i mbajë GPU-të në orët e tyre të trajnimit. Rrjetëzimi duhet të jetë një strukturë që ndajnë këto katër kuti, jo një shteg përmes pirgut të zyrës. Magazinimi duhet të furnizojë çipat. Nëse shkëmbyesit e nxehtësisë në derën e pasme nuk përshtaten, thuajeni dhe ndaloni. Mos jepni një kuotë PUE për dy rafte në një sallë të përzier. Ky numër do të ishte teatër.

Pastaj ai e vendos këtë në vetë punën e trajnimit:

Pikë kontrolli çdo 30 minuta në pishinën lokale të shpejtë. Nëse një rang vdes, rifilloni nga pika e fundit e kontrollit e plotë. Mos prisni në SAN. Mos vazhdoni stërvitjen ndërsa orët kanë rënë nga nxehtësia. Regjistrojeni dhe ndaloni që të shohim ndalesën.

Një orë e mirë duket kështu: të tetë GPU-të në orët e stërvitjes, skedari i pikës së kontrollit u ul, puna ende në hap me hapa të sigurt. Një orë e keqe duket kështu: ventilatorët në kulmin e thirrjes, orët ulen, pika e kontrollit 2% e shkruar pas dhjetë minutash dhe dikush në zyrë që thotë "klasteri është aktiv". Ngritja nuk është stërvitje.

Si ta testoni

Ata e shkruajnë testin para modifikimit, që është edhe qëllimi i mosbesimit ndaj një demonstrimi.

  • E njëjta recetë 12-epokëshe, të njëjtat 120,000 fotografi inspektimi, tetë xhirime

  • Koha është me orë muri për një recetë të përfunduar, duke përfshirë çdo rinisje, e matur nga paraqitja e punës deri në pikën e fundit të kontrollit të epokës 12

  • Një kalim në nxehtësi: Orët e GPU-së qëndrojnë në objektivin e stërvitjes për ekzekutimin. Një ngjarje e ngadalësimit është një dështim edhe nëse puna përfundimisht përfundon

  • Një kalim në ruajtje: koha e shkrimit të pikës së kontrollit, mediana dhe më e keqja, nga regjistri i punës

  • Një kalim në pëlhurë: puna nuk rri në pritje kolektive ndërsa një gradë është e shëndetshme. Nëse ata nuk mund ta shohin atë pritje, instrumentimi nuk është bërë

  • Dy nga tetë vrapimet marrin një rang të vrarë në një hap të caktuar, me qëllim, për të testuar rrugën e rinisjes

  • Përfundimi është një test i veçantë me 200 imazhe nga linja e fabrikës deri te kutia e servirjes e rrethuar. Suksesi në stërvitje nuk llogaritet si sukses në servirje

  • Ata regjistrojnë fuqinë e raftit nga PDU-të në mostra 15-minutëshe, kështu që askush nuk ka nevojë të shpikë një megavat

Pranimi për ta quajtur qelizën "të gatshme për inteligjencën artificiale": 8 nga 8 recetat përfundojnë; 0 nga 8 tregojnë ngadalësim termik; të dy ekzekutimet e ndërprera rifillojnë; pikat e kontrollit mbeten brenda disa minutash. Nëse e humbasin këtë, ata ende kanë një dhomë serverash me karta grafike të sofistikuara.

Rezultati

Rezultat ilustrues, nga një provë e sajuar me tetë seri, jo një shifër e publikuar e Kestrel-it.

Supozime: katër servera me dy përshpejtues në dy rafte; një model inspektimi; 120,000 fotografi statike; tetë ekzekutime të një recete fikse 12-epokëshe; ora e murit përfshin rinisjet derisa të përfundojë receta; shpejtësia do të thotë një ndërprerje e regjistruar e orës së stërvitjes; koha e kontrollit është shkrimi, jo dëshira; fuqia e raftit është mostra PDU, jo një PUE kampusi.

Përpara rimodelimit, GPU-të në rafte të zakonshëm me ajër të ftohur në Ethernet-in e zyrës dhe VM SAN:

  • 5 nga 8 vrapimet përfunduan në përpjekjen e parë. Mesatarja e kohës së murit midis këtyre pesë: 14 orë

  • 3 nga 8 duhej të fillonin përsëri pas një bllokimi rreth orës 11 (dy pasi një nyje vdiq me një pikë kontrolli të vjetër, një pasi një pikë kontrolli mbushi SAN-in). Ripërpjekje e menjëhershme, pa pritje gjatë natës në orë: 11 orë të humbura plus një përpjekje e dytë 14-orëshe, ose 25 orë deri në një recetë të përfunduar në ato të treja

  • Koha mesatare për të përfunduar një recetë në të tetë, përfshirë rifillimet: 18 orë. (Pesë në orën 14, tre në orën 25. Mesatarja e të tetëve është ende 14, gjë që do t'i fshihte rifillimet. Kjo është arsyeja pse mesatarja është vlera bazë këtu.)

  • Mbushje termike e regjistruar në 7 nga 8 vrapime. Koha mesatare në orë të reduktuar: 3 orë në një përpjekje 14-orëshe

  • Shkrimi në pikën e kontrollit: mesatarisht 22 minuta

  • Vrasja me gradë nuk ishte një provë që mund ta kalonin. Ata nuk kishin një libër vrapimi. Dy vdekjet aksidentale ishin zbulimi

  • Ngarkesa maksimale e IT-së në dy raftet gjatë trajnimit: rreth 18 kW. Rreshti kishte vatët. Nuk kishte ftohjen ose pëlhurën

Pas shkëmbyesve të nxehtësisë në derën e pasme në ato dy rafte, një pëlhure të dedikuar midis katër nyjeve, një grupi të vogël NVMe për pikat e kontrollit, pikat e kontrollit 30-minutëshe dhe një libri ekzekutimi për rinisje:

  • 8 nga 8 përfunduan në përpjekjen e parë. Ora mesatare e murit: 9 orë

  • Mbushje termike: 0 nga 8

  • Shkrimi i pikës së kontrollit: mesatarja 90 sekonda. Më e keqja në set: 3 minuta

  • Dy vrasjet e qëllimshme të rangut rifilluan nga pika e kontrollit e fundit 30-minutëshe. Një kohëzgjatje shtesë në ato dy vrapime: rreth 40 minuta secila, përfshirë diagnozën, kështu që ato të dyja qëndruan afër 9 orë e 40 minuta. Mesatarisht, në tetë raunde të palëvizshme, arritën në 9 orë

  • Ngarkesa maksimale e IT-së është ende rreth 18 kW. Çipat e njëjtë. Sjellje e ndryshme e ndërtesës

Në të gjithë këtë mostër, koha mesatare për të përfunduar një recetë ra nga 18 orë në 9 orë, ose 9 orë për secilën, 72 orë në tetë cikle. Për herën e parë, koha e përfundimit shkoi nga 5 nga 8 në 8 nga 8. Koha e gazit shkoi nga 7 nga 8 në 0 nga 8. Numri i fundit është ai që tregon nëse kanë blerë përshpejtues apo peshues letre. Ata nuk do ta quajnë ndryshimin e kohës një kursim prej 50% në prodhim. Tetë cikle janë një grup i vogël dhe i lehtë.

Këto shifra janë një vlerësim shembullor bazuar në testin e deklaruar, një mostër të vogël, një model dhe një sallë të përzier. Ato nuk janë një PUE, as një megavat i kampusit dhe as provë që Kestrel duhet të ndërtojë një vend trajnimi në një fushë. Rishikimi i regjistrave u bë brenda 9 orëve; ata nuk e fshehën atë. Shifra prej 18 kW është një lexim i rrumbullakosur i PDU-së, jo një faturë shërbimesh. Ata nuk i konvertuan 72 orët në një kosto, sepse tarifa e përzier e energjisë elektrike e fabrikës do të kishte krijuar një rast të rremë biznesi.

Kontrolli i servirjes ishte i veçantë dhe më i vogël: 200 imazhe me vija në zonën e rrethuar, të gjitha në vend. Ky është përfundim, jo ​​stërvitje. Përzierja e të dyjave do të kishte qenë gabimi i sallës hibride në miniaturë.

Çfarë mund të shkojë keq

  • Prokurimi vazhdon t'i quajë katër servera "qendra e të dhënave të inteligjencës artificiale". Etiketa fsheh instalimet hidraulike dhe blerja tjetër është më shumë GPU për të njëjtin korridor të sëmurësh

  • Ndërruesit e derës së pasme futen dhe askush nuk e vë në punë anën e ujit. Ventilatorët ende bërtasin. Orët ende bien

  • Fabrika është një ndërprerës i vetëm pa shteg rezervë. Një lidhje e dështuar dhe "grupi" është përsëri katër stacione pune

  • Pikat e kontrollit qëndrojnë në SAN sepse grupi NVMe ishte "faza e dytë". Faza e dytë nuk arrin para nyjes tjetër të vdekur

  • Ata japin një kuotë PUE për dy rafte në një sallë të përzier. Klima, kufiri dhe pjesa tjetër e rreshtit ERP e bëjnë atë raport një kostum

  • Trajnimi dhe shërbimi ndajnë strukturën. Një përmbytje e pikave të kontrollit e bën radhën e fabrikës të presë. Latencia e bishtit është produkti atje, jo dendësia

  • Një nyje vdes dhe dikush e trajton atë si një biletë për kohëzgjatje funksionimi në vend të një rinisjeje të pikës së kontrollit. Operatorët e ndërmarrjes dhe operacionët e inteligjencës artificiale flasin me njëri-tjetrin për një pasdite të tërë

  • Ata mund të kishin marrë me qira një kafaz, por imazhet nuk mund të largohen. Duke harruar atë kufizim, ata futen në një bisedë në re, ku do të duhet të relaksohen

Përgatitje praktike për të marrë me vete

Ajo që është një Qendër e të Dhënave të IA-së, në këtë formë, nuk është një depo dhe nuk është një faturë GPU. Është qeliza që i lejon përshpejtuesit të përfundojnë punën: energjia që mund të mbajnë, nxehtësia që largohet, një strukturë, një pikë kontrolli dhe dikush në grep kur një rang vdes. Kestrel nuk kishte nevojë për një kampus. Ata kishin nevojë për dy rafte për të ndaluar së pretenduari. Shumica e ekipeve duhet ta marrin me qira këtë sjellje. Disa, me një grup të dhënash sekrete dhe një sallë që mund të përballojë nxehtësinë, duhet të ndërtojnë një qelizë dhe të refuzojnë rrëshqitjen.

Pyetje të shpeshta

Çfarë është një Qendër e të Dhënave të IA-së?

Një vend llogaritës me dendësi të lartë ku energjia, ftohja, rrjetëzimi dhe ruajtja e të dhënave përqendrohen në trajnimin paralel dhe shërbimin e modelit, jo në rreshta të rregullta serverash me qëllim të përgjithshëm. Është projektuar në mënyrë që një numër i madh përshpejtuesish të mund të trajnojnë dhe shërbejnë modele pa u shkrirë, pa u bllokuar në rrjet ose pa pritur në disk. Një sallë e zakonshme ndërmarrjeje është një lagje e përzier. Një sallë e inteligjencës artificiale është një monokulturë, njësia e vlerës së së cilës është përshpejtuesi, siç janë GPU-të ose çipat në stilin TPU. Duket si një depo dhe sillet si një central elektrik që bën llogaritje.

Si ndryshon një qendër të dhënash IA nga një qendër të dhënash normale?

Sallat tradicionale optimizohen për ngarkesa të përziera pune dhe kohëzgjatje të funksionimit në shumë shërbime të vogla. Sitet e inteligjencës artificiale i përmbysin raportet: dendësia rritet, rrjeti bëhet një strukturë pa të cilën puna e trajnimit nuk mund të funksionojë, dhe ruajtja duhet t'i mbajë pikat e kontrollit në lëvizje ose përshpejtuesit qëndrojnë të papunë. Operatorët e ndërmarrjes mendojnë për biletat dhe dritaret e ndryshimit. Operatorët e inteligjencës artificiale mendojnë për radhët e punës dhe ndjenjën e keqe kur një nyje vdes vonë në një periudhë afatgjatë. Ju prapë mund t'i telefononi të dy qendrat e të dhënave. Etiketa thjesht fsheh hidraulikët.

Pse qendrat e të dhënave të inteligjencës artificiale përdorin kaq shumë energji?

Pajisjet që spikat nuk janë një CPU e zgjuar. Është tabaka e përshpejtuesit: GPU ose çipa të tjerë të IA-së, të paketuara në servera, pastaj rafte, pastaj rreshta që ndajnë një strukturë me gjerësi të lartë bande. Dendësia për raft është kthesa e ngjarjes: më pak rafte, secili prej tyre një furrë e vogël. Megavat ngarkesë IT shfaqen sapo një sallë mbushet, megjithëse shpikja e një shifre tipike nuk ia vlen. Faktori kufizues është shpesh nënstacioni, jo lista e dëshirave të GPU-ve.

Si ftohen qendrat e të dhënave të inteligjencës artificiale?

Raftet me dendësi të lartë e largojnë nxehtësinë në një mënyrë që ajrit nuk i është kërkuar kurrë ta trajtojë. Mund ta shtyni ajrin më fort me shkëmbyes të nxehtësisë në derën e pasme, korridore më të nxehta dhe një kontroll të zgjuar. Pastaj shfaqet lëngu: ftohje direkte në çip, sythe ftohësi dhe zhytje në disa dizajne. Një përshpejtues që e ul shpejtësinë është një për të cilin keni paguar tashmë dhe nuk mund ta përdorni plotësisht. PUE ende ka rëndësi sepse çdo vat i shpenzuar për ventilatorë dhe pompa është një vat që nuk shkoi në një GPU. Edhe uji është pjesë e historisë: disa impiante pinë, disa gëlltisin.

Pse rrjetëzimi ka po aq rëndësi sa GPU-të?

Trajnimi është një bisedë: mijëra përshpejtues që shkëmbejnë gradiente, parametra dhe copëza të një modeli në sinkronizim të ngushtë. Nëse pëlhura lëkundet, e gjithë puna pret në kërcimin më të ngadaltë. Kjo është arsyeja pse sallat e inteligjencës artificiale fiksohen pas rrjetëzimit me gjerësi të lartë bande, vonesës së ulët, pëlhurave të ngjashme me InfiniBand ose Ethernet në të njëjtin rol, dhe topologjive që nuk palosen përgjysmë kur një lidhje dështon. Inference kujdeset për vonesën e pasme, shumë kërkesa më të vogla dhe izolimin. Në këtë ndërtesë, hidraulikët janë restoranti.

Për çfarë përdoret një Qendër e të Dhënave të IA-së: për trajnim apo për nxjerrje përfundimesh?

Trajnimi është një fushatë: mblidh një klaster, furnizoje me të dhëna, vendos një kontroll fetar dhe vazhdo për orë ose javë të tëra. Inferenca është një vitrinë: modele tashmë të trajnuara, që tani po përgjigjen, me një vonesë që ka rëndësi. Kampuset e trajnimit ndjekin pushtetin, tokën dhe dendësinë. Vendet e inferencës ndjekin vonesën dhe praninë. Sallat hibride ekzistojnë sepse kapitali nuk është i pafund, ndonjëherë një sallë me dy sythe ftohjeje. Një përshpejtues pak më i vjetër pranë klientit mund të mposhtë një përshpejtues joshës një kontinent larg.

Pse ka rëndësi ruajtja e të dhënave në një qendër të dhënash të inteligjencës artificiale?

Të dhënat e trajnimit duhet të mbërrijnë mjaftueshëm shpejt sa GPU-të të mos jenë duke lëvizur me shpejtësi. Pikat e kontrollit duhet të ndodhin në mënyrë që një bllokim të mos humbasë një javë. Peshat e modelit duhet të ngarkohen përpara se një kopje shërbyese të jetë aktive. Prodhimi i kapacitetit të ruajtjes, jo vetëm kapaciteti, është pengesa e qetë. Mund të shpenzoni një pasuri për përshpejtues dhe t'i lini ata pa energji me një grup të sjellshëm të projektuar për makina virtuale.

Çfarë ndodh kur një nyje vdes në mes të ekzekutimit?

Një përshpejtues i vdekur në një punë trajnimi të lidhur fort mund ta bllokojë të gjithë korin. Trajnimi kërkon pika kontrolli, jo optimizëm. Inferenca e zbraz nyjen e sëmurë, mban një kopje që përgjigjet dhe qëndron aktive. Dritaret e ndryshimit ende përplasen me ekzekutimet e trajnimit që nuk interesohen për kalendarin tuaj. Redundanca ende ka rëndësi për energjinë, ftohjen, shtigjet dhe ruajtjen, por mënyra e dështimit është më pak e rregullt sesa rrëshqitja e vjetër me nëntë minuta kohë funksionimi.

Cili është ndikimi i një Qendre të të Dhënave të IA-së në rrjet, ujë dhe fqinjë?

Lidhja me rrjetin është shpesh procesi i vërtetë i përzgjedhjes së vendndodhjes. Toka është e lehtë krahasuar me një nënstacion dhe një shërbim që ka klientë të tjerë. Uji për ftohje, nëse e përdorni, bëhet problem për fqinjët sapo reshjet e shiut janë të padurueshme, së bashku me zhurmën, masën vizuale dhe nxehtësinë në një gardh kufitar. Trajnimi mund të fshihet në tregjet më të lira të energjisë dhe klimat më të ftohta. Inference pëlqen të jetë pranë përdoruesve. Nuk ka një vendndodhje të përsosur. Ekziston një kompromis me një njoftim për shtyp.

A duhet të zotëroj një qendër të dhënash të inteligjencës artificiale, apo duhet ta marr me qira?

Shumica e njerëzve nuk kanë nevojë të zotërojnë një nga këto salla. Hipershkallëzuesit ndërtojnë sepse produkti është flota. Laboratorët ndërtojnë kur koha e radhës është bllokimi ose të dhënat nuk mund të largohen. Një bankë, spital, qeveri ose prodhues me një grup të dhënash sekret mund ta bëjë racional një kafaz kolo në vend ose një kafaz privat. Të gjithë të tjerët duhet të marrin me qira: koloksion të gatshëm për inteligjencë artificiale, një rezervim në cloud ose një klaster të menaxhuar. Ju merrni përshpejtuesit pa u bërë operator i një termocentrali.

Referencat

  1. IEA - www.iea.org

  2. LBNL - datacenters.lbl.gov

  3. Rrjeti i Gjelbër - www.thegreengrid.org

  4. LBNL - datacenters.lbl.gov

  5. LBNL - datacenters.lbl.gov

  6. Instituti i Kohës së Funksionimit - journal.uptimeinstitute.com

  7. NVIDIA - developer.nvidia.com

  8. NVIDIA - docs.nvidia.com

  9. NVIDIA - docs.nvidia.com

  10. NVIDIA - docs.nvidia.com

  11. Google Cloud - docs.cloud.google.com

Gjeni IA-në më të fundit në Dyqanin Zyrtar të Asistentëve të IA-së

Rreth Nesh

Kuiz
1. Sipas artikullit, çfarë është një qendër të dhënash e inteligjencës artificiale?

2. Në versionin vende-jo-pallate, çfarë duhet të bëjë një ekip si Kestrel kur imazhet e fabrikës nuk mund të largohen nga vendi?

3. Pse artikulli përdor mesataren 18-orëshe, jo medianën 14-orëshe, si vlerë bazë para rinovimit?

4. Pas rimodelimit me dy rafte në provën ilustruese me tetë pista, çfarë ndryshoi?

5. Çfarë thotë artikulli në lidhje me citimin e PUE për këtë qelizë me dy rafte?


Kthehu te blogu