Kontinuerlig inlärning av färdigheter hos robotar: Nytt ramverk efterliknar mänskligt livslångt lärande

by Albert
Konceptillustration av robotiserad LRL-process. a, Översiktlig illustration av den allmänna LRL-processen. Till skillnad från konventionella multi-task-metoder, där agenter har samtidig tillgång till alla uppgifter, kan en LRL-agent bemästra uppgifter sekventiellt, en efter en. Dessutom bör agenten kontinuerligt ackumulera kunskap under hela processen. Detta koncept emulerar den mänskliga inlärningsprocessen. b, Vårt föreslagna ramverk enligt konceptet livslångt lärande. Vi instruerar den utplacerade förkroppsligade agenten att utföra uppgifter på lång sikt med hjälp av språkkommandon. Agenten utför dessa uppgifter genom att kombinera och återanvända förvärvad kunskap. Kredit: Meng et al (Nature Machine Intelligence, 2025).

Människor är kända för att ackumulera kunskap över tid, vilket i sin tur gör det möjligt för dem att kontinuerligt förbättra sina förmågor och färdigheter. Denna förmåga, som kallas livslångt lärande, har hittills visat sig vara svår att återskapa i system för artificiell intelligens (AI) och robotteknik.

Ett forskarlag vid Technical University of Munich och Nanjing University, under ledning av Prof. Alois Knoll och Dr. Zhenshan Bing, har utvecklat LEGION, ett nytt ramverk för förstärkt inlärning som kan utrusta robotsystem med förmågan till livslångt lärande.

Deras föreslagna ramverk, som presenteras i en artikel i Nature Machine Intelligence, kan bidra till att öka robotars anpassningsförmåga och samtidigt förbättra deras prestanda i verkliga miljöer.

”Vår forskning har sitt ursprung i ett projekt om robotisk metaförstärkningsinlärning 2021, där vi ursprungligen utforskade Gaussiska blandningsmodeller (GMM) som priors för uppgiftsinferens och kunskapskluster”, berättade Yuan Meng, första författare till uppsatsen, Tech Xplore.

”Även om detta tillvägagångssätt gav lovande resultat, stötte vi på en begränsning – GMM kräver ett fördefinierat antal kluster, vilket gör dem olämpliga för scenarier för livslångt lärande där antalet uppgifter i sig är okänt och utvecklas asynkront.

”För att lösa detta vände vi oss till Bayesianska icke-parametriska modeller, särskilt Dirichlet Process Mixture Models (DPMM), som dynamiskt kan justera antalet kluster baserat på inkommande uppgiftsdata.”

LEGION-ramverket utnyttjar en klass av modeller som kallas DPMM och gör det möjligt för algoritmer som tränats med hjälp av förstärkningsinlärning att kontinuerligt förvärva, bevara och återanvända kunskap i en föränderlig ström av uppgifter. Forskarna hoppas att detta nya ramverk ska bidra till att förbättra AI-agenters inlärningsförmåga och föra dem ett steg närmare det livslånga lärande som observerats hos människor.

”LEGION-ramverket är utformat för att efterlikna mänskligt livslångt lärande genom att låta en robot kontinuerligt lära sig nya uppgifter samtidigt som den bevarar och återanvänder tidigare förvärvad kunskap”, förklarar Meng.

”Det viktigaste bidraget är ett icke-parametriskt kunskapsrum baserat på en DPMM, som dynamiskt avgör hur kunskapen struktureras utan att det krävs ett fördefinierat antal uppgiftskluster. Detta förhindrar katastrofal bortglömdhet och möjliggör flexibel anpassning till nya, okända uppgifter.”

Demonstration av det föreslagna LEGION-ramverkets prestanda i verkligheten vid lösning av manipulationsuppgiften med lång horisont: ”städa bordet”. Kredit: Nature Machine Intelligence (2025). DOI: 10.1038/s42256-025-00983-2

Det nya ramverket som introducerades av Meng, Prof. Knoll, Dr. Bing och deras kollegor integrerar språkinbäddningar som kodas från en förtränad stor språkmodell (LLM). Denna integration gör det möjligt för robotar att bearbeta och förstå en användares instruktioner och tolka dessa instruktioner oberoende av uppgiftsdemonstrationer.

”Dessutom underlättar vårt ramverk kunskapskombination, vilket innebär att en robot kan lösa uppgifter med lång tidshorisont – till exempel att rengöra ett bord – genom att på ett intelligent sätt sekvensera tidigare inlärda färdigheter som att skjuta på föremål, öppna lådor eller trycka på knappar”, säger Meng.

”Till skillnad från konventionell imitationsinlärning, som bygger på fördefinierade sekvenser, möjliggör LEGION flexibla kombinationer av färdigheter i valfri ordning, vilket leder till större generalisering och flexibilitet i verkliga robotapplikationer.”

Forskarna utvärderade sin metod i en serie inledande tester och tillämpade den på ett verkligt robotsystem. Resultaten var mycket lovande, eftersom LEGION-ramverket gjorde det möjligt för roboten att konsekvent samla in kunskap från en kontinuerlig ström av uppgifter.

”Vi visade att icke-parametriska Bayesianska modeller, särskilt DPMM, kan fungera som effektiva förkunskaper för livslångt lärande av robotar”, säger Meng. ”Till skillnad från traditionell multitaskinlärning, där alla uppgifter lärs in samtidigt, kan vårt ramverk dynamiskt anpassa sig till ett okänt antal uppgifter och bevara och kombinera kunskap för att förbättra prestandan över tid.”

Det arbete som nyligen utförts av Meng, professor Knoll, Dr Bing och deras kollegor kan ligga till grund för framtida insatser för att utveckla robotar som kontinuerligt kan inhämta kunskap och förfina sina färdigheter över tiden. LEGION-ramverket kan förbättras ytterligare och tillämpas på ett brett spektrum av robotar, inklusive servicerobotar och industrirobotar.

”En robot i hemmiljö skulle till exempel kunna lära sig hushållssysslor över tid, förfina sina färdigheter baserat på feedback från användaren och anpassa sig till nya uppgifter när de uppstår”, säger Meng. ”På samma sätt kan robotar i industriella miljöer stegvis lära sig och anpassa sig till förändrade produktionslinjer utan att det krävs omfattande omprogrammering.”

I sina kommande studier planerar forskarna att arbeta med att ytterligare förbättra avvägningen mellan stabilitet och plasticitet i livslångt lärande, eftersom detta skulle göra det möjligt för robotar att på ett tillförlitligt sätt behålla kunskap över tid, samtidigt som de också anpassar sig till nya miljöer eller uppgifter. För att göra detta kommer de att integrera olika beräkningstekniker, inklusive generativ återuppspelning och kontinuerlig backpropagation.

”En annan viktig inriktning för framtida forskning är kunskapsöverföring mellan plattformar, där en robot kan överföra och anpassa inlärd kunskap mellan olika utföranden, t.ex. humanoida robotar, robotarmar och mobila plattformar”, tillägger Meng.

”Vi vill också utöka LEGIONs kapacitet bortom strukturerade miljöer, så att robotar kan hantera ostrukturerade, dynamiska miljöer i verkligheten med olika objektarrangemang. Slutligen ser vi framför oss att utnyttja LLM för att anpassa belöningar i realtid, så att robotar kan förfina sina uppgiftsmål dynamiskt baserat på verbal eller kontextuell feedback.”

För mer information: Yuan Meng et al, Preserving and combining knowledge in robotic lifelong reinforcement learning, Nature Machine Intelligence (2025). DOI: 10.1038/s42256-025-00983-2.

Related Articles

Leave a Comment