Kunstig intelligens

MagicTime: Et gjennombrudd i AI‑generert tidsforløpsvideo

mm
Legg til Securities.io blant dine foretrukne kilder på Google
Opplysning: Securities.io kan motta betaling når du bruker lenker til produkter vi vurderer. Dette påvirker ikke våre redaksjonelle vurderinger. Vi er ikke en registrert investeringsrådgiver; dette er ikke investeringsråd. Les vår affiliateopplysning.
MagicTime

Et team av forskere fra anerkjente universiteter avduket en ny tekst‑til‑video AI‑modell som er i stand til å generere metamorfiske tidsforløpsvideoer. Den nye modellen, MagicTime, kan skape både visuelt fengende og vitenskapelig meningsfulle bilder. Som sådan kan den utdype forskeres forståelse av naturlige fenomener og innlede en ny æra innen forskning. Her er det du trenger å vite.

Den raske veksten i AI‑videogeneratormarkedet

Det globale AI‑videogeneratormarkedet er et raskt utviklende landskap som er projisert å vokse til $0,9 milliarder innen slutten av dette året. Denne veksten er bare spissen av isfjellet på milliarder, med noen analytikere som forutsier at markedet vil være verdt $1,5 milliarder innen 2029 og $2,56 milliarder innen 2032. Veksten drives av ulike faktorer, som forbrukere som foretrekker AI‑videoer fremfor tekstalternativer, ifølge rapporter.

Hva er tekst‑til‑video (T2V) AI?

Tekst‑til‑video‑markedet er en viktig bidragsyter til videogenerasjonsindustrien. Disse systemene lar brukere legge inn sine bildekrav via et chat‑vindu. De er enkle å bruke og fortsetter å forbedre resultatene, og forbedrer hva maskiner kan visualisere, syntetisere og skape. OpenAIs Sora er et utmerket eksempel på denne typen bildeskapere.

Utfordringene med å fange metamorfiske prosesser med AI

Til tross for alle deres evner, finnes det fortsatt områder hvor AI‑videogenerering mangler. For eksempel er tradisjonelle modeller ute av stand til å innkapsle metamorfiske prosesser. Metamorfiske prosesser refererer til ting som et frø som vokser til et tre, en blomst som blomstrer, eller til og med en bygning som går gjennom sine bygge‑stadier.

Dagens mest avanserte AI‑modeller sliter med å produsere disse hverdagslige hendelsene fordi de mangler en iboende forståelse av virkelige fysiske lover og tidsdynamikk. Datamaskiner har problemer med å lage noe som et tre som vokser fordi de mangler en ekte forståelse av hvordan og hvorfor det vokser, utover videoreferanser.

Du kan se disse begrensningene i dagens beste AI‑modeller. De kan produsere imponerende bilder, men hvis de blir bedt om å lage en video av et tre som vokser, vil bevegelsen være begrenset, variasjonene dårlige, og inntrykket generelt urealistisk. For at AI skal overvinne disse begrensningene, må den oppnå en grundig forståelse av komplekse naturlige transformasjoner.

Inni MagicTime AI‑studien

For å forstå dette kravet samlet forskere fra hele verden seg for å undersøke hvordan man på en tilstrekkelig måte kan kode fysisk kunnskap om den virkelige verden inn i en AI‑modell. De dokumenterte sin reise og hvordan de overvant utfordringen med å generere tidsforløpsvideoer som autentisk dupliserer fysisk metamorfose i studien “MagicTime: Time-lapse Video Generation Models as Metamorphic Simulators“, publisert i IEEE Transactions on Pattern Analysis and Machine Intelligence.

Hva er MagicTime?

Kjernen i deres forskning var en ny AI‑modell kalt MagicTime. Denne åpne kildekode‑tekst‑til‑video AI‑en utnytter multidimensjonal bevissthet, noe som gjør den i stand til å lage nøyaktige metamorfiske tidsforløpsvideoer. Systemet bruker en to‑trinns tilnærming som gjør at AI kan utvikle seg utover enkel scenesyntese.

Trinn 1: Integrering av fysisk kunnskap i AI

Den første fasen av AI‑modellen utnytter fysisk kunnskap fra metamorfiske videoer for å endre forhåndstrente T2V‑modeller. Denne strategien gjør at systemet raskt kan referere til og deretter generere metamorfiske videoer som kan representere nøyaktige hendelser som cupcakes som hever i ovnen eller is som smelter over tid.

Hvordan Magic‑tekst‑enkoderen forbedrer forståelsen

Kjernen i MagicTime AI‑modellen er en avansert AI‑tekst‑enkoder. Dette systemet er designet for å forbedre forståelsen av metamorfiske videoprompt, slik at AI‑modellen kan lage et bilde basert på den innsendte informasjonen og kryssreferere med eksisterende data samt en forståelse av fysikk og natur.

Trinn 2: Dynamisk rammeekstraksjon for realistiske sekvenser

Systemet bruker deretter en prosess for dynamisk rammeekstraksjon for å hente informasjon som tett ligner på det forespurte bildet. Ingeniørene bemerket at ved å integrere en tidslogikk som er konsistent med virkelige dynamikker, kan AI produsere jevne og nøyaktige videoer av fenomener som røtter som vokser gjennom jord.

Rollen til ChronoMagic‑Bench-datasettet

Chronomagic‑dataene er det som skiller teamets AI‑modell fra forgjengeren. Dette datasettet inneholder over 2000 detaljerte og bildetekst‑merkede tidsforløpsvideoer. De høykvalitets videoene ble valgt fordi de inneholder viktig data som virkelige kjemiske, fysiske, biologiske og sosiale fenomener.

Hvordan diffusionsmodellen driver MagicTime

Den U‑Net‑baserte diffusionsmodellen i MagicTime fungerer som et avansert generativt nevralt nettverk som bruker støy‑refineringstrategier for å lage nøyaktige bilder. Systemet skaper sammenhengende visuell data via en åpen kildekode‑modell som arbeider direkte med en Diffusion‑Transformer‑arkitektur for å forlenge klippetiden til opptil 10 sekunder.

Reell testing av MagicTime AI

Ingeniørene testet AI‑en for å sikre dens evner. Som en del av testfasen ble AI bedt om å lage bilder som krevde lært kunnskap om den fysiske verden, for eksempel en plante som vokser i en klar vase.
Teamet bemerket at AI var i stand til å lage sofistikerte, fysikk‑bevisste videosimuleringer som inkluderte naturlige aspekter som vekst, forfall og transformasjonsprosesser. Dataene avdekket et nytt nivå av realisme, og styrket ingeniørenes ønske om å bruke denne AI‑modellen til vitenskapelige forskningsformål.

Resultater: MagicTimes ytelse i å generere realistiske klipp

Etter omfattende eksperimentering bemerket teamet at den oppgraderte AI‑modellen viste overlegen ytelse og effektivitet ved generering av høy‑kvalitets og dynamiske metamorfiske videoer. Systemet var i stand til å lage ulike scenarier samtidig som det opprettholdt fysisk plausibilitet og fulgte naturlige og vitenskapelige teorier.

Klippspesifikasjoner: Oppløsning og lengde

Ifølge ingeniørene kan MagicTime lage to‑sekunders klipp med 512 × 512‑piksler. Klippene har for øyeblikket kun 8 bilder per sekund. De integrerer imidlertid metamorfisk generering for å forbedre AI‑evnene.

Hvordan MagicTime lærer virkelige fysiske lover

De bemerket at MagicTime er i stand til å lære kunnskap om virkelige fysiske lover fra tidsforløpsvideoer. Videoene ga systemet en implisitt forståelse av hvordan ting vokser og transformeres over tid. Merkverdig var at testene inkluderte AI som fulgte dynamiske fysiske lover og tidsmønstre for å lage levende videoklipp på sekunder.

Fordeler ved å bruke MagicTime AI for tidsforløpsgenerering

Det finnes en lang liste med fordeler som MagicTime bringer til markedet. For det første gir den brukerne muligheten til å lage nøyaktige og raske simuleringer av metamorfiske hendelser. Denne evnen kan la forskere simulere de kjemiske, biologiske, fysiske eller sosiale egenskapene til virkelige objekter med høy presisjon.

MagicTime gjør AI‑trening mer effektiv

MagicTime AI‑modellen representerer et transformativt sprang i hvordan ingeniører trener AI‑modeller. Det er den første AI‑videogeneratoren som integrerer tekst‑prompt og vitenskapelige data for effektivt å replikere naturlige fenomener, som hvordan en kjemikalie kan blande seg med en annen substans. Ingeniører kan laste inn nye metamorfiske videosamples, noe som videreutvikler modellens forståelse av den virkelige verden.

MagicTime kan generere lengre, mer realistiske klipp

MagicTime‑modellen kan produsere 10‑sekunders lange metamorfiske klipp som nøyaktig viser tidsforløpsdetaljer som vekst eller forfall. De lengre klippene utvidet brukbarheten og evnene til AI‑modellen, og gjorde det mulig for forskere å få mer forståelse av komplekse fenomener.

Fleksibilitet: Simulering av naturlig og kunstig metamorfose

MagicTime gir brukerne et høyt nivå av fleksibilitet. Den kan etterligne et mangfold av metamorfiske hendelser, både naturlige og menneskeskapte fenomener. Denne studien er første gang en videogenerator har tatt hensyn til viktig data som vekstrater, miljøpåvirkninger og stokastiske biologiske faktorer for å forme sine bildesvar.

MagicTimes åpne kildekode‑økosystem

En av hovedgrunnene til at MagicTime sannsynligvis vil få omfattende bruk i de kommende månedene, er at den har et sterkt fellesskapsfokus. Ingeniørene publiserte U‑Net‑versjonen som en åpen kildekode‑protokoll, som gjør at alle kan forbedre og integrere den i sine systemer. Denne tilnærmingen bidrar til å skape et engasjerende fellesskap som vil støtte innovasjon og kreativitet.

Reelle bruksområder og adopsjonstidslinje

Det finnes mange bruksområder for MagicTime AI‑modellen. For det første kan selskaper spare penger ved å bruke disse systemene i stedet for å gjennomføre virkelige tester. Systemet kan fungere som en foreløpig testrunde, og sikre at den sekundære runden blir mer fokusert på nøkkeldetaljer.

Hvordan MagicTime kan revolusjonere vitenskapelig forskning

Ingeniørene bak denne studien tror at MagicTime en dag vil bli et uunnværlig verktøy for forskere og forskningspersonell. Systemet eliminerer store deler av testkostnadene og akselererer den foreløpige utforskningen av vitenskapelige konsepter.

MagicTimes potensial i underholdning

MagicTime AI‑modellen vil finne sin vei inn i underholdningsindustrien. Du kan forvente å se mer realistisk naturlig progresjon i fremtidige spill. Forestill deg å logge inn i ditt RPG og legge merke til detaljer som et tre som brenner ned til bakken på samme måte som i virkeligheten.

MagicTime som verktøy for utdanning og visuell læring

Denne AI‑modellen kan også hjelpe utdanningssektoren. Studenter kan bruke systemet for å få verdifull innsikt i viktige konsepter og naturlige metamorfiske endringer. De kan se disse endringene skje via videoklipp, som supplerer andre læringsmetoder for å skape en helhetlig tilnærming til utdanning som styrker kreativitet og produktivitet.

Åpen kildekode og veien videre

MagicTime U‑net‑modellen er tilgjengelig og åpen kildekode. Ingeniørene håper at denne tilnærmingen vil gi systemet en sterk tilhengerskare og utvide dets evner etter hvert som flere brukere utvikler dens unike tjeneste. Du kan forvente å se flere AI‑systemer integrere denne tilnærmingen i løpet av de neste 2–3 årene.

Hvem skapte MagicTime?

Studien av MagicTime AI‑videomodellen var et samarbeid mellom flere universiteter, inkludert datavitere ved University of Rochester, Peking University, University of California, Santa Cruz, og National University of Singapore. Spesifikt lister artikkelen forfatterne som Shanghai Yuan, Jinfa Huang, Yujun Shi, Yongqi Xu, Ruijie Zhu, Bin Lin, Xinhua Cheng, Li Yuan og Jiebo Luo.

Fremtiden for MagicTime og AI‑samarbeid

Forskerne ser denne utviklingen og lanseringen av den åpne kildekode‑modellen som et viktig steg mot å drive innovasjon, åpenhet og samarbeid. De håper at denne tilnærmingen vil gjøre det mulig for ingeniører fra ulike vitenskapelige felt som datavitenskap, fysikk, biologi og til og med samfunnsvitenskap å slå seg sammen og forbedre sine metoder i de kommende årene.

Investering i AI‑markedet

AI‑markedet er en av de raskest voksende bransjene. Denne nye æraen innen AI‑drevne produkter har en blanding av markedsaktører fra langvarige teknologigiganter som NVIDIA (NVDA ) til gjennombruddsbedrifter som ChatGPT og andre. Her er ett selskap som fortsetter å presse grensene for datavideosyntese.

Adobe (ADBE): En leder innen kreative AI‑løsninger

Adobe (ADBE ) er ett av de største navnene innen programvareutvikling. Selskapet kom inn i markedet i desember 1982 og har hovedkontor i San Jose, California. Det ble grunnlagt av John Warnock og Charles Geschke. Interessant nok er navnet avledet fra Adobe Creek, en liten bekk som ligger bak Warnocks hus.

ADBE Prisdiagram


David Hamilton er en fulltidsjournalist og en langvarig bitcoinist. Han spesialiserer seg på å skrive artikler om blockchain. Hans artikler har blitt publisert i flere bitcoin-publikasjoner, inkludert Bitcoinlightning.com