Apple I deres nye forskningsartikel viser de, hvordan store sprogmodeller (LLM'er) kan bruges til at analysere lyd- og bevægelsesdata for mere præcist at genkende brugerhandlinger. Ifølge forfatterne kan LLM'er forbedre fortolkningen af sensoriske data betydeligt, selv i situationer, hvor kun en lille mængde data er tilgængelig. miniUndersøgelsen med titlen "Using LLMs for Late Multimodal Sensor Fusion for Activity Recognition" undersøger, hvordan sprogmodeller kan kombineres med traditionelle sensorer (såsom mikrofoner).onem eller bevægelsessensorer) og opnå en bedre forståelse af konteksten for brugerens aktivitet. Forskerne forklarer, at selv uden særlig træning kan LLM'er mere præcist bestemme, hvad en person laver, og deres succesrate stiger yderligere, når de suppleres med et enkelt eksempel.
Du kunne være interesseret i
Det er dog vigtigt, at modellerne i denne undersøgelse ikke blev givet rå audio data, men kun korte beskrivelser genereret af separate modeller for lyd og bevægelse. Bevægelsessensorerne (accelerometer og gyroskop) skabte således et tekstresumé, som LLM derefter arbejdede med. Apple brugte Ego4D-datasættet, en stor samling af førstepersonsvideooptagelser. Forskerne udvalgte tolv almindelige aktiviteter, såsom støvsugning, madlavning, motion, computerarbejde og sport. Hver stikprøve var 20 sekunder lang, hvilket muliggjorde en ensartet vurdering på tværs af scenarier.
Lyd- og bevægelsesdataene blev først behandlet af mindre modeller, der producerede tekstlige beskrivelser eller forudsigelser af aktivitet. Disse tekstlige output blev derefter vurderet af LLM-modeller. Gemini 2.5 Pro og Qwen-32B. Apple undersøgte deres præstation i to tilstande: med en foruddefineret liste over aktiviteter (lukket liste) og i en åben tilstand uden muligheder (åben). Undersøgelsen viser, at sprogmodeller effektivt kan kombinere output fra forskellige sensorer og bidrage til en bedre forståelse af aktiviteter, især hvor selve rådataene nestachi.