AI-vezérlőszoftver egy precíziós laboratóriumi műszerhez

A kihívás

A Space Needle terméke egy pásztázó alagútmikroszkópnak (röviden STM) nevezett tudományos műszert vezérel; ezt az eszközt a tudósok egyedi atomokról készített felvételekhez használják. Úgy működik, hogy egy rendkívül hegyes tűt, úgynevezett tipet, mintegy 2 nanométerrel a vizsgált felület fölött lebegtet. Ez nagyjából egy emberi hajszál vastagságának ötvenezred része. A legapróbb rezgés (egy elhaladó teherautó, léptek a folyosón, még a légáramlatok is) hozzáérintheti a tipet a felülethez, és eltörheti azt. Egyes laborokban egy tip csak néhány óráig bírja, és akár 500 euróba is kerülhet a cseréje, ami törékeny és drága munkafolyamattá teszi a csúcskategóriás mikroszkópiát.

A Space Needle ötlete az, hogy aktívan semlegesítse ezeket a rezgéseket, mielőtt elérnék a tipet, néhány gyorsan pörgő lendkerék segítségével (ez egy olyan koncepció, amelyet onnan kölcsönöztek, ahogyan a műholdak a világűrben tartják magukat egy adott irányba). A nehézséget nem a mechanika jelenti, hanem az agy. Valaminek másodpercenként több ezerszer kell eldöntenie, pontosan hogyan mozgassa ezeket a lendkerekeket, hogy ellensúlyozza azokat a zavarokat, amelyeket előre nem lát. Egy hagyományos, kézzel hangolt szabályozó önmagában nem elég precíz; egy tisztán AI-vezérelt szabályozó önmagában nem elég megbízható. A Wozifyt azért vonták be, hogy megépítse azt a szoftvert, amely a probléma mindkét felét megoldja.

A megoldás

Egy teljes Python szoftverstacket szállítottunk, amelynek középpontjában egy modern AI-technika, a megerősítéses tanulás (reinforcement learning) áll (ugyanaz az algoritmuscsalád, amely megtanította a számítógépeket legyőzni az embereket Go-ban és drónokat vezetni). Az architektúra tudatosan párosít egy bevált, kézzel hangolt klasszikus szabályozót egy neurális hálózattal, amely apró korrekciókat tanul rá. A klasszikus rész biztosítja a biztonságos, kiszámítható viselkedést; az AI rész kezeli azokat a zavaros, valós világbeli hatásokat, amelyeket a matematikai modellek nem tudnak megragadni. Az iparág ezt a mintát „reziduális megerősítéses tanulásnak” hívja, ami egy pragmatikus módja annak, hogy a hagyományos mérnöki munka megbízhatóságát és a modern AI alkalmazkodóképességét ugyanabban a rendszerben egyesítsük.

A leszállított szoftver négy szorosan integrált komponenst tartalmaz:

  • Fizikailag pontos digitális iker. Építettünk egy szimulátort (a MuJoCót használva, egy csúcskategóriás fizikai motort, amelyet széles körben alkalmaznak a robotikában és az AI-kutatásban), amely a valós eszközt reális hardverkorlátokig modellezi: milyen gyorsan tudnak felpörögni a lendkerekek, mekkora erőt tudnak leadni, és milyen típusú alacsony frekvenciájú rezgéseket termel egy valódi laboratórium. A szimulátoron belüli tréning nagyságrendekkel olcsóbb és biztonságosabb, mint egy valódi mikroszkópon való tréning.
  • AI-vezérlő. Egy PPO (Proximal Policy Optimization) neurális hálózati policy, amelyet PyTorch és Stable-Baselines3 segítségével valósítottunk meg, korrekciós módosításokat tanul egy klasszikus stabilizátorra ráépülve. A kódbázis támogatja mind a reziduális megközelítést, mind a tisztán végponttól végpontig tartó tanulást, egy konfigurációs kapcsolóval kiválasztva, így az ügyfél egymás mellett tudja összehasonlítani őket.
  • Mérnöki minőségű tréningpipeline. 1 kHz-es fizikai szimuláció, 100-200 Hz-es szabályozási hurok, determinisztikus seedelés a reprodukálható kísérletekhez, automatikus epizódmegszakítás, ha a biztonsági határértékek túllépésre kerülnek, valamint anti-windup védelmek, amelyek a betanított policyt a valódi hardver tényleges képességein belül tartják.
  • Interaktív kiértékelő eszközök. Egy élő 3D nézegető lehetővé teszi a mérnökök számára, hogy futásidőben „megbökjék” a szimulált eszközt, és valós időben figyeljék, ahogy az AI helyreáll, emellett szkriptelt benchmarkok is rendelkezésre állnak, amelyek tiszta, numerikus mutatókkal hasonlítják össze az AI-vezérelt viselkedést a klasszikus alapvonallal.

A szoftverben minden tervezési döntést a végső, valós világbeli prototípus szem előtt tartásával hoztunk meg. A szimulátoron belüli aktuátorkorlátok, szenzorzaj és rezgésprofilok illeszkednek ahhoz a hardverhez, amelyet a Space Needle épít, ami közvetlenül a robotikai alkalmazott AI legnagyobb hibamódját célozza meg: azokat a policykat, amelyek gyönyörűen működnek szimulációban, de szétesnek valódi hardveren (ezt a problémát a szakterületen „sim-to-real gap”-nek, azaz szimuláció-valóság szakadéknak hívják).

Space Needle simulation: reinforcement-learning AI controller stabilising a virtual microscope tip inside a physics-accurate digital twin

Az eredmény

Nagyjából két hónap alatt a Wozify eljuttatta a Space Needle-t egy üres kódbázistól egy működő, betanítható AI-vezérlőig, az összes olyan kiegészítő infrastruktúrával, amelyre egy kis kutatócsapatnak szüksége van az iterációhoz. A szállított elemek a következők:

  • Egyparancsos tréning-munkafolyamat, amely egy robusztus AI-vezérlőt hoz létre egy biztonságos klasszikus alapvonalra építve.
  • Reprodukálható, numerikus benchmarkok (négyzetes középérték és csúcs tip-mozgás), amelyek számszerűsítik, mennyivel jobb az AI-vezérelt rendszer, mint önmagában a klasszikus alapvonal.
  • Egy interaktív vizualizáció, amely lehetővé teszi a nem szakértők számára, hogy lássák, ahogy az AI helyreáll szándékos “megbökésekből”, így a rendszert könnyű bemutatni befektetőknek és partnereknek.
  • Beépített biztonsági határértékek és anti-windup védelem, hogy semmi, amit az AI a szimulációban megtanul, ne legyen fizikailag lehetetlen valódi hardveren.

Üzleti szempontból a szoftver közvetlenül támogatja a Space Needle laborok felé irányuló értékajánlatát: már az is, ha a tipek károsodási rátáját megfelezik, jelentős éves megtakarítást jelent műszerenként, és ami még fontosabb, kiszámítható kísérleti időt biztosít az azokat használó tudósoknak. A projekt azt is megmutatja, mire képes egy modern AI-eszközökkel felszerelt kis csapat rövid időn belül: egy kutatási szintű ötletből bemutatható, befektetésre kész szoftvert alakít ki, nagy mérnöki létszám nélkül.

A projekt technológiai stackje

Python programming language

Python

PyTorch deep learning framework

PyTorch

MuJoCo physics simulation engine

MuJoCo

Gymnasium reinforcement learning environment

Gymnasium

Stable-Baselines3 by DLR-RM

Stable‑Baselines3

Hosszú távú eredmények

Egy újrafelhasználható AI-vezérlési stack. Az általunk kialakított minta (egy biztonságos, klasszikus szabályozó, rátéve egy tanult AI-korrekcióval) tisztán átvihető más precíziós műszeres problémákra is, nemcsak mikroszkópokra.
Gyorsabb iteráció, kisebb kockázat. A szimulátoron belüli tréning azt jelenti, hogy a Space Needle perceken belül tud tesztelni szabályozói módosításokat, anélkül hogy kockáztatna egy drága laboreszközt.
Hiteles út a szimulációtól a valódi hardverig. Reális fizika, biztonsági korlátok és zaj van beépítve a tréninghurokba, ami csökkenti a szakadékot aközött, ami a szimulációban működik, és ami a laborpadon.
Egyértelmű üzleti eset. A hosszabb eszközélettartam kevesebb fogyóeszközt, kevesebb üzemeltetői állásidőt és kiszámíthatóbb kutatási időt jelent, ami csúcskategóriás műszerek esetén gyorsan összeadódik.