Kujuta ette serverikiipi, mis ei käivita pelgalt mudelit, vaid järgib peenetundeliselt selle mänguplaani. Google'i insenerid ehitavad vaikselt täpselt seda: serveri kiirendit koodnimega Frozen v2, mis integreerib osasid Gemini arhitektuurist pooljuhtidesse, eesmärgiga oluliselt tõsta energiatõhusust ja vähendada latentsust.
Info pärineb The Informationi raportist, mis tsiteerib kahte siseringi allikat. Nende väide on tähelepanuväärne: Frozen v2 suudaks töödelda kuus kuni kümme korda rohkem tokeneid vati kohta kui Google'i viimased tensori töötlusüksused. Sihtaeg? 2028. Motiveering on otsekohene ja tuttav kõigile, kes on näinud pilvepõhise nõudluse ületamas võimsust; väidetavalt pidi Google Cloud mõne klienditehingu AI-töötluse kitsaskohtade tõttu tagasi lükkama.
Arhitektuuri sisse ehitamine reeglite asemel
Traditsioonilised TPU-d ja GPU-d on üldotstarbelised. Sa laadid mudeli ja riistvara teeb palju jooksuajalisi otsuseid, kuidas andmeid liigutada, milliseid operatsioone ajastada ja millal mälu hankida. See paindlikkus on võimas, kuid sellega kaasneb lisakoormus. Frozen v2 läheneb teistmoodi: see fikseerib teatud Gemini-spetsiifilised otsused transistoritasemelisse loogikasse. Tulemuseks on vähem täitmisetappe ja vähem päringu kohta liigutatavat andmemahu. Vähem liikumist. Vähem lisakoormust. Madalam latentsus. Uued reaalaja kasutusvõimalused muutuvad tõenäolisemaks.

Olulisel määral kaaluti veelgi julgemat ideed. Varased Frozeni disainid, mida juhtis Jeff Dean, püüdsid väidetavalt riistvarasse otse sisse juurutada mudeli kaalud. See oleks olnud radikaalne optimeerimine. Samas oleks see kiiresti vananenud — ühe mudeliversiooniga seotud kiibid on väga lühikese kasutusajaga. Google leidis kesktee. Frozen v2 looks to embed the architecture skeleton while keeping weights updateable, nii et sama kiip saaks teenindada mitut Gemini väljaannet, kui need järgivad samu arhitektuurimustreid.
See lähenemine võiks vähendada vastusaegu piisavalt, et avada uusi interaktiivseid ja madala latentsusega AI-rakenduste klasse.
Google ei plaani asendada oma TPU-laevastikku Frozen v2-ga. Mõtle sellele kui eksperimentaalsele rajale, mis töötab TPU-tootmise kõrval — testialusena spetsialiseerituma pooljuhtide uurimiseks, kuni mudelite disainid stabiliseeruvad. TPU tooteteekaart eraldas hiljuti treeningu ja inferentsi vajadused, kui Cloud Next üritusel aprillis tehti teatavaks kaheksanda põlvkonna kiibid. Frozen v2 projekt on väiksema mahuga; Google ei plaani samas mahus massitootmist nagu TPU-de puhul.
Frozen v2 oodatav saabumine langeb kokku ka teiste tööstusharu liigutustega. Väidetavalt on Google sõlminud Inteliga lepingu pakendada üle kolme miljoni TPU-kiibi kuni 2028. Samal ajal uurivad idufirmad ja konkurendid juba mudeli-teadlikku riistvara. Torontos baseeruv Taalas tõi turule oma HC1 kiibi, mis on paaritatud Llama 3.1 8B-ga ja väidetavalt saavutab 17 000 tokenti sekundis ilma pakendi pealse HBM-ita. Start-up kogus umbes €186 miljonit rahastust. Eelmisel aastal sõlmis Nvidia tehnoloogialitsentsi lepingu Groqiga väärtusega umbes €18,6 miljardit, mis näitab, et turg näeb mudeli käitumise ja riistvara integreerimises suurt väärtust.
Siin on kompromisse. Arhitektuuri sisse ehitamine vähendab teatud tüüpi paindlikkust. See eelistab kasutusjuhtumeid, kus mudeliperekonnad jäävad aja jooksul järjepidevaks. Samuti muudab see toote elutsüklit: pooljuht, mis on disainitud ümber mudeli arhitektuuri, peab olema õigustatud prognoositava disaini stabiilsuse ja juurutamise mahuga. See seletab Google'i ettevaatlikku hoiakut. Frozen v2 on eksperimentaalne; mitte iga eksperiment ei saa tooteks.
Praegu pole Google Frozen v2 avalikult kinnitanud. Ettevõtte pressiesindaja meenutas The Informationile, et paljud sisemised projektid ei jõua tootmisse. Sellegipoolest on põhiline idee — liigutada osa mudeliloogikast pooljuhtidesse energia säästmiseks ja latentsuse kärpimiseks — liikunud akadeemilisest uudishimust konkurentsistrateegiaks. Oodata on, et rohkem ettevõtteid katsetab sarnaseid kombinatsioone mudeli-teadlikust riistvarast ja uuendatavatest kaaludest, kuna nõudlus tõhusa ja madala latentsusega AI järele jätkab kasvu.





Arutelu
Jäta kommentaar
Kommentaarid
Kommentaare veel pole. Ole esimene.