Tekoäly

Palaute‑silmukat voivat johtaa LLM:ien “mallikollapsiin”, joka muistuttaa härkärappea

mm
Lisää Securities.io suosikkilähteisiisi Google-palvelussa
Ilmoitus:

Securities.io voi saada korvauksen, kun käytät arvioimiemme tuotteiden linkkejä. Tämä ei vaikuta toimituksellisiin arvioihimme. Emme ole rekisteröity sijoitusneuvoja; tämä ei ole sijoitusneuvontaa. Lue kumppanuusilmoituksemme.

Neural network with visible glitch

Kysymys on noussut esiin generatiivisen tekoälyn maailmassa. Ongelma on niin voimakas ja monimutkainen, että se saattaa vaarantaa generatiivisen tekoälyn laajuuden. Ennen kuin sukellamme syvemmälle tämän ongelman ymmärtämiseen, katsotaan nopeasti, miksi tekoälyn nousevalla käyrällä odotettu este pidetään niin merkittävänä. 

Miten tekoälyn oletetaan tekevän maailmasta tehokkaamman

Viime vuosina generatiivisen tekoälyn tarjoamat hyödyt ovat lisänneet sen käyttöönottoa merkittävästi. 92 % Fortune 500 -yrityksistä on ottanut generatiivisen tekoälyn käyttöön, kun taas 70 % GenZ:stä on kokeillut näitä työkaluja.

Generatiivisen tekoälyn levinneisyys on niin laaja, että lähes 90 % Yhdysvaltain työpaikoista voisi olla sen vaikutuksen alaisia, ja 95 % asiakaskontakteista saattaa siihen liittyä vuoteen 2025 mennessä. Vaikka nykyinen markkina on arvoltaan lähes US$45 miljardia, tekoäly voi vain kasvaa ja luoda jopa 97 miljoonaa työpaikkaa seuraavan vuoden aikana. 

Tekoälyn mahdollistava potentiaali on ollut vertaansa vailla, vähintäänkin sanottuna. Yli kaksi miljoonaa ohjelmistokehittäjää rakentaa OpenAI:n API:a, ja suurin osa näistä kehittäjistä on Fortune 500 -yrityksistä, joilla olisi ollut pääsy parhaisiin resursseihin. Silti he valitsivat kehittää API:n avulla.

Tämä myönteinen suhtautuminen generatiivisen tekoälyn potentiaaliin heijastuu myös Deloitte:n tekemässä kyselyssä, jonka mukaan 94 % liiketoimintajohtajista uskoi, että tekoäly on avain tulevaan menestykseen.

Kaikista näistä tiedoista ja faktoista on selvää, että monet ihmiset ympäri maailmaa odottavat generatiivista tekoälyä tulevaisuuden kasvun mahdollistajana. Kuitenkin on noussut esiin ongelma, joka voi haastaa tekoälyn kasvupotentiaalin: palaute‑silmukat. Seuraavissa osioissa tarkastelemme tätä ongelmaa tarkemmin, pohtien sen mahdollisia seurauksia ja vaikutuksia.

Mitä palaute‑silmukat ovat

Perusmuodossaan palaute‑silmukat eivät ole huonoja tai haitallisia. Ne ovat prosessi, jossa hyödynnetään tekoälyjärjestelmän tuottamaa tulosta ja vastaavia loppukäyttäjän toimia mallien uudelleenkouluttamiseksi ja parantamiseksi ajan myötä. 

Luonteensa vuoksi niitä kutsutaan suljetuksi silmukaksi, ja prosessia kutsutaan suljetun silmukan oppimiseksi. Tässä tapahtuu jatkuva vertailu tekoälyn tuottaman tuloksen ja lopullisen päätöksen välillä, jotta mallille voidaan antaa palautetta ja sen avulla se oppii virheistään. 

Kuitenkin ongelma tällaisessa palaute‑silmukan oppimisessa syntyy, kun käytetään synteettistä dataa. Generatiivisten tekoälymallien kouluttaminen vaatii valtavia määriä dataa, joka on rajoitettua ja niukkaa niin, että mallit kuluttavat koulutusresurssinsa kokonaan. 

Siksi suuryritykset haluavat hyödyntää synteettistä dataa kouluttaakseen tekoälymallien tulevia sukupolvia. Synteettisellä datalla on kuitenkin sekä etuja että haittoja. 

Synteettisen datan edut ja haitat

Synteettisellä tai tekoälyn luomalla datalla on monia etuja. Esimerkiksi se on halvempaa kuin todellinen data, ja—mikä tärkeintä—tämän datan saatavuus on rajaton.

Koska data on synteettistä, se ei tule todelliselta yksilöltä eikä aiheuta suuria yksityisyysriskejä. Toisaalta todellinen data, erityisesti med-tech- ja terveydenhuoltosektoreilla, altistuu tietosuojaloukkauksille. Lisäksi on tapauksia, joissa synteettisen datan käyttö on parantanut tekoälyn suorituskykyä. 

Kuitenkin toisaalta, liian paljon synteettistä dataa saaneet AI-mallit voivat tulla rajoittuneiksi toiminnallisuudessaan ja potentiaalissaan, aiheuttaen negatiivisia vaikutuksia generatiivisten AI-mallien tuleviin iterointeihin. Tämän riskin odottaminen ei ole perusteeton, sillä äskettäinen tutkimus, jonka on tehnyt Digital Signal Processing group at Rice University vahvistaa tätä. 

Richard Baraniukin, Rice-yliopiston C. Sidney Burrus -professorin sähkö- ja tietojenkäsittelytekniikassa mukaan:

“Ongelmat syntyvät, kun tätä synteettistä datakoulutusta toistetaan väistämättä, muodostaen eräänlaisen palaute‑silmukan ⎯ mitä kutsumme autofagosoiseksi tai ‘itsensä kuluttavaksi’ silmukaksi.”

Synteettisen datan aiheuttamien palaute‑silmukoiden haaste

Synthetic Data-Induced Feedback Loops

Nyt, jotta ymmärrämme ongelman koko luonteen, meidän on tarkasteltava palaute‑silmukoiden ja synteettisen datan tapausta yhdessä. Professori Baraniuk on tiivistänyt ongelman seuraavasti: “Ryhmässämme on työskennelty laajasti tällaisissa palaute‑silmukoissa, ja huono uutinen on, että jopa muutaman sukupolven koulutuksen jälkeen uudet mallit voivat tulla korjaamattomasti korruptoituneiksi. Tätä on joitakin kutsuneet ‘mallikollapsiksi’ ⎯ , viimeisimpänä alalla työskentelevät kollegat suurten kielimallien (LLM) yhteydessä. Me kuitenkin katsomme termin ‘Model Autophagy Disorder’ (MAD) sopivammaksi, verrattuna härkärappeaan.”

Selittääksemme tämän vertauksen merkityksen, härkärappea on kuolettava neurodegeneratiivinen sairaus, joka vaikuttaa lehmiin ja sillä on ihmisvastine, joka syntyy tartunnan saaneen lihan syönnistä. Se verrataan palaute‑silmukan haasteeseen, jonka generatiiviset tekoälymallit kohtaavat, koska tauti leviää ruokkimalla lehmiä niiden teurastettujen vertaisten prosessoiduilla jäljellejääneillä. Jäljelle jääneen datan tai prosessin itsensä sivutuotteena syntyvän datan syöttämistä on ‘infektio’, joka ylläpitää tulevaisuuden generatiivisia tekoälymalleja.  

Tutkimus, joka tarkasteli tätä ongelmaa, oli nimeltään ‘Self-Consuming Generative Models Go MAD.’ Mitä myös merkittävää on, että tutkimus on ensimmäinen vertaisarvioitu työ AI-autofagiasta, joka käsittelee suosittuja ja tunnettuja visuaalisia AI-malleja kuten DALL-E, Midjourney ja Stable Diffusion. Vaikka tiimi työskenteli visuaalisen AI:n parissa, kuten professori Baraniuk totesi, “samat härkärappean korruptio-ongelmat esiintyvät myös LLM:issä.”

Nyt kun olemme tarkastelleet ongelmaa ja sen taustalla olevia tekijöitä, meidän on tarkasteltava sen vaikutuksia ja tapoja, joilla se saattaa vaikuttaa generatiivisten AI-mallien tulevaan kehitykseen. 

Tuoreen datan puute, joka johtaa epäterveeseen tekoälyyn

Keskeinen ongelma, joka johtuu vaikuttuneesta tai infektoituneesta LLM:stä, on köyhä tekoälymalli. Tuoreen todellisen datan puutteessa tulokset vääristyvät ja niiltä puuttuu laatu ja monimuotoisuus. 

Selittääksemme tämän tilanteen selkeämmin ja visuaalisemmin, voimme tarkastella ihmiskasvojen generointia tekoälyn avulla. Kun data syötetään edistyksellisten iteratiivisten silmukoiden kautta, kasvojen yhtenäistymisen mahdollisuus, jossa kaikki kasvot näyttävät yhä samalta henkilöltä, kasvaa. 

Tällaisen vahingollisen mahdollisuuden intensiteetti on vakava, vähintäänkin sanottuna. Intensiteetti voidaan arvioida Baraniukin kommentista, jossa hän sanoo:

“Jotkut seuraukset ovat selviä: ilman riittävää tuoretta todellista dataa tulevat generatiiviset mallit ovat tuomittuja MADnessiin.”

Onko tähän maailmanlopun kaltaiseen tilanteeseen, joka näyttää nousevan AI-kehityksen maailmassa, mitään parannuskeinoa? Toistaiseksi tutkijat ovat esittäneet otantaharhan parametrin, joka huomioi käyttäjien taipumuksen suosia datan laatua monimuotoisuuden kustannuksella. Tätä taipumusta kutsutaan ‘Cherry Picking’ -menetelmäksi. Hyvä puoli on, että se auttaa säilyttämään datan laadun useampien mallien iteraatioiden aikana. Kuitenkin kompromissi on monimuotoisuuden suurempi väheneminen. 

Olemme jo nähneet, millaisia vaikutuksia tekoäly voi saada tulevaisuuden maailmaamme. Kun näin paljon potentiaalia on valmiina vapautettavaksi, tämä ongelma saattaa vaikuttaa moniin sidosryhmiin, erityisesti uusiin ja innovatiivisiin yrityksiin, jotka ovat työskennelleet sen parissa. 

Google on yksi eturivin yrityksistä, joka tarjoaa LLM:ien voiman laajalle ja monipuoliselle sidosryhmälle. AI:n tuottaman sisällön monimuotoisuuden puute on asia, jonka Googlen on käsiteltävä tulevina päivinä. Tässä tarkastelemme lyhyesti Google AI:n kykyjä LLM:ien tarjoamisessa. 

#1. Google AI

Tekoälyn alalla kaksi operatiivista siipeä, jotka auttavat Google saavuttaa tavoitteensa ovat Google DeepMind ja Google Cloud. Selittääksemme yhteistyön tarkemmin, Google Cloud tuo Google DeepMindin kehittämät ja testatut innovaatiot yrityskelpoiseen AI-alustaansa, jotta asiakkaat voivat alkaa käyttää niitä generatiivisten AI-ominaisuuksien rakentamiseen ja toimittamiseen. Google Cloud tarjoaa kolme LLM-palvelua.

  • Ensimmäinen on Generative AI on Vertex AI, joka mahdollistaa käyttäjien pääsyn Googlen suuriin generatiivisiin AI-malleihin testattavaksi, hienosäädettäväksi ja käyttöönotettavaksi heidän AI-pohjaisissa sovelluksissaan.
  • Toinen on Vertex AI agent builder, joka on tarkoitettu yrityshaku- ja chatbot-sovelluksiin. Se sisältää valmiita työnkulkuja tavallisiin tehtäviin, kuten perehdytys, datan keruu, räätälöinti jne.
  • Viimeinen on Contact Center AI, älykäs asiakaspalveluratkaisu, joka sisältää Dialog Flow’n, Googlen keskustelevaa AI-alustaa, jossa on sekä tarkoituspohjaisia että LLM-ominaisuuksia.

Kuitenkin Googlekin kohtasi omat ongelmansa AI:n oikeudenmukaisessa hyödyntämisessä. Tänä toukokuussa Google-CEO Sundar Pichai korosti, että yritys oli väärässä, kun se tuotti rotuun perustuvia puolueellisia kuvatuloksia käyttäjien kyselyihin. 

Google joutui keskeyttämään Geminin kuvanluontiominaisuudet sosiaalisen median käyttäjien valitellessa, että ratkaisu levitti vääriä kuvia, mukaan lukien värillisten ihmisten esittäminen natsien kuvauksissa. 

Heijastaen suurta osaa tässä siteeratuista tutkimuksista, yritys myönsi, että ongelma syntyi “rajoituksista Geminin kehittämiseen käytetyssä koulutusdatassa”.

Konkretisoiden tarkemmin, missä ongelma piilee, Sundar Pichai totesi myös:

“On tilanteita, jolloin vastaat [kysymyksiin kuten] ‘Mikä on Yhdysvaltojen väkiluku?’ Kyllä, se on vastattavissa oleva kysymys. [Mutta] on hetkiä, jolloin haluat selata laajaa mielipiteiden kirjoa verkossa, mikä on hakukoneen tehtävä, ja se tekee sen hyvin.”

Pichain mukaan Googlen vuosien aikana tekemä työ varmistaa, että – hakunäkökulmasta – yritys tarjoaa luotettavaa, korkealaatuista tietoa. 

GOOGL Hintakaavio

Taloudellisesti Alphabet Inc. (GOOG ) (Googlen emoyhtiö) raportoi 2023 tuloiksi 307,4 miljardia dollaria, 9 % enemmän kuin 2022:n 282,8 miljardia dollaria. Liikevoitto oli 84,3 miljardia dollaria, merkittävä nousu 74,8 miljardiin edellisvuonna. Vaikka toimintakulut nousivat 223,1 miljardiin dollariin, nettotulos oli 73,8 miljardia dollaria, verrattuna 60 miljardiin dollariin vuonna 2022.

#2. Cohere

Toinen toimija, joka on tehnyt erinomaista työtä tällä alalla, on torontolainen Cohere. Yksi heidän hankkeistaan, joka ansaitsee erityisen maininnan, on ‘Cohere for AI‘, voittoa tavoittelematon tutkimuslaboratorio, jonka tavoitteena on ratkaista monimutkaisia koneoppimisongelmia. Toisin kuin perinteinen tutkimusryhmä, Cohere for AI toimii hybridilaboratoriona, jossa on omistautunut tutkimushenkilöstö ja tuki avoimen tieteen aloitteille. Yritys tekee avointa yhteistyötä itsenäisten tutkijoiden kanssa ympäri maailmaa suorittaakseen huippuluokan ML-tutkimusta. 

Cohere:n avoimen tieteen tutkimusyhteisö on leikkaava tila, joka koostuu tutkijoista, insinööreistä, kielitieteilijöistä, yhteiskuntatieteilijöistä ja elinikäisistä oppijoista. Yhteisö kukoistaa yli sadan maan kontribuutioiden ansiosta. 

Cohere:n malleihin kuuluvat Aya 23 – 8B ja Aya 23 – 35B, huippuluokan helposti saatavilla olevat tutkimus-LLM:t, C4AI Command R – 104B ja C4AI Command R – 35B, mallipainot tutkimuksen demokraattisen saatavuuden edistämiseksi, sekä Aya, massiivisesti monikielinen tutkimus-LLM. 

Äskettäin Cohere ja Fujitsu ilmoittivat strategisen kumppanuuden yritys-AI-palveluiden kehittämiseksi ja tarjoamiseksi teollisuuden johtavien japanin kielen kykyjen kanssa. Yhteistyön ehtojen mukaan yritykset rakentavat tehokkaita yritystason suuria kielimalleja (LLM), jotka palvelevat globaalien yritysten tarpeita.

Maaliskuussa tänä vuonna Cohere ilmoitti hakevansa 5 miljardia dollaria arvostusta viimeisimmässä varainkeruussaan. Se pyrki keräämään noin 250 miljoonaa dollaria tämän rahoituskierroksen kautta, lähteen mukaan, joka on asiassa perehtynyt.

Lopulliset ajatukset

LLM:t ja ne generatiiviset AI-mallit, joita ne ohjaavat, nousevat esiin ja kehittyvät nopeasti. Tämä alue sisältää huipputeknologiaa, joka on valtavan kunnianhimoinen ja intensiivisesti tavoitteellinen. Siksi on perusteltua odottaa merkittävää tutkimusvirtaa tällä alalla tulevina vuosina. 

Tutkimusorganisaatiot, suuryritykset, oppilaitokset—kaikki mahdolliset sidosryhmät haluavat tehostaa resurssien kohdentamista tällä alalla. Tällainen toiminnan vilinä merkitsisi lisää haasteita esiin. Mutta se myös merkitsisi kurssin korjaamista, laatikon ulkopuolelle ajattelua ja olemassa olevien ratkaisujen uudelleenkuvittelua mahdollisimman optimoidulla tavalla.

Klikkaa tästä oppiaksesi kaiken tekoälyyn sijoittamisesta.

Gaurav aloitti kryptovaluuttojen kaupankäynnin vuonna 2017 ja on sen jälkeen rakastunut kryptovaluuttojen maailmaan. Hänen kiinnostuksensa kaikkeen kryptovaluuttoja koskien teki hänestä kirjailijan, joka on erikoistunut kryptovaluuttoihin ja blockchainiin. Pian hän löysi itsensä työskentelemästä kryptovaluutta-yritysten ja median kanssa. Hän on myös suuri Batman-fani.