Nad ehitasid midagi Mythosest võimsamat ja panid selle siis laboris ukse taha. See otsus ütleb teile rohkem tehisintellekti riskide olukorra kohta kui ükski pressiteade.
Laboris: võimekus ilma avaliku käivitamiseta
Anthropic'i värskeim riskihinnang paljastab vaikselt tehtud kaalutletud otsuse: Mudel 2, Mythosega seotud sisemine mudel, ei avalikustata. Ettevõte ütleb, et mudel edestas Mythost paljudes siseülesannetes, sealhulgas programmeerimises, agentpõhistes töövoogudes ja sünteetiliste andmete genereerimises, kuid jääb praegu uurimisvaraks. Lühike lause. Suur järeldus.
Miks tagasi hoida? Sest võimekus on vaid üks pool. Anthropic'i on oma üldist kokkusobimatuse riskihinnangut tundlikes stsenaariumites tõstnud "väga madalast" "madalaks". See sõnastus on oluline. See näitab kasvavat ebakindlust selle osas, kas keerukad mudelid jäävad inimeste eesmärkidega kooskõlas tegutsema, kui need skaleeruvad.
On veel üks nüanss. Anthropic'i teadlased näevad märke, et mudelid kiirendavad oma teadus- ja arendusvõimekust. Mõelge sellele kui masinatele, mis muutuvad osavamaks paremate masinate disainimisel. See võib märkimisväärselt kiirendada arengut. Samas võib see väärkasutuse korral avada uusi ründeteid ja ootamatuid tõrkeid. Ettevõte võrdleb Mudel 2 saavutusi varasemate hüpetega; meeskonna sõnul on tegemist olulise edasimineku, kuid mitte Opus 4.6-st Mythosele ulatuva hüppega.

Mudel 2 mitteavalikustamine kuulub tuntud kõrge riskiga tehnoloogia lähenemise hulka: eksperimenteeri ettevõtte sees, õpi kiiresti ja piira avalikku kokkupuudet, kuni kontrollimeetmed jõuavad järele. See on ettevaatlik hoiak. OpenAI viivitas hiljuti oma Astra mudeli avaliku juurutamisega sarnastel põhjustel, viidates muredele kübervõimekuste osas. Tööstusharu peatub erinevates kohtades, kuid peatumine ise muutub strateegiliseks.
Mida see tähendab üldise tehisintellekti võidujooksu jaoks? Peatumine võib olla tugev positsioon. Kõige võimekamate süsteemide hoidmine kontrollitud väravate taga lubab meeskondadel uurida tõrkeviise, tugevdada kaitseid ja kujundada hindamismeetodeid. Samuti koondab see võimu. Kui üks labor jätkab kiiret sisearendust, samal ajal kui teised aeglustavad, võib see labor teisi ette tõmmata üldintellekti poole viivatel radadel. Just sellepärast jälgivad seda reguleerijad ja avalikkus.
Edusamme mõõta muutub raskemaks mudelite arenedes. Varem mõistlikud võrdlusmõõdikud kaotavad selgust. Ülesandepõhised testid ei hõlma enam tekkivaid võimeid ega peeneid viise, kuidas mudelid liidavad järeldamist pikemateks autonoomseteks protsessideks. Kui soovite mõista tänast riski, vajate pingetestimist, mis matkib reaalse maailma väärkasutust, dünaamilisi vastaseid proovikatsumusi ja pidevat seiret, mitte ühekordset skoori.
Anthropic'i sõnum on ilma trikitamiseta selge: võimekuse kasv on reaalne, ebakindlus suureneb ja tagasihoidlikkus on teadlik valik. Ettevõte ei avalikusta käivitamiskava. Seniks on Mudel 2 meeldetuletuseks sellest, et tehniline piir ja ohutuspiir peavad arenema käsikäes, muidu võib tasakaal kalduda soovimatute tagajärgede poole.




Arutelu
Jäta kommentaar
Kommentaarid
Kommentaare veel pole. Ole esimene.