Az AI-vízjel megmutathatja, gép írta-e a szöveget
Az EU-s szabályok nyomán egyre több mesterségesintelligencia-szolgáltatás jelölheti a generált tartalmakat. Egy friss vizsgálat szerint azonban a szöveges vízjel egyes modelleknél azt is befolyásolhatja, hogyan reagálnak a kockázatos utasításokra.
Az AI által írt szöveg felismerésére szánt láthatatlan jelölés egyes modelleknél azt is megváltoztathatja, mennyire tartják be a biztonsági korlátaikat. Andrea Siposova, a Lasso Security kutatójának vizsgálata szerint a SynthID-Text nevű megoldással ellátott modellek bizonyos esetekben másként utasították vissza a káros kéréseket, mint ugyanazok a modellek vízjel nélkül.
Ez azért érdekes a hétköznapi felhasználónak is, mert a mesterséges intelligencia már nem csak szöveget fogalmaz: kereshet, összefoglalhat, ügyintézési lépéseket készíthet elő, és egyes rendszerek más programokat is használhatnak. Ha egy technikai változtatás a válasz hangvételén túl azt is módosítja, hogy a rendszer mikor mond nemet, azt a szolgáltatóknak külön ellenőrizniük kell.
Mire való a szöveges vízjel?
Az Európai Unió új szabályozása nyomán az AI-platformok olyan eljárásokat vezetnek be, amelyekkel az általuk létrehozott tartalom eredete azonosítható lehet. Ezt nevezik eredetjelölésnek: a cél, hogy később ellenőrizhető legyen, nagy valószínűséggel mesterséges intelligencia készített-e egy szöveget.
A Google által létrehozott és nyílt forráskódúként kiadott SynthID-Text ilyen megoldás. Az Anthropic korábban azt is közölte, hogy jövőbeli Claude-modelleinél ezt az eljárást fogja használni.
A vízjel itt nem egy felirat a bekezdés végén, és az olvasó elvileg nem lát belőle semmit. A rendszer titkos kulcs segítségével finoman tereli, melyik következő szót válassza a modell. Egy mondatban például két hasonló jelentésű szó közül nem feltétlenül a legvalószínűbbet választja, hanem azt, amelyik illeszkedik a rejtett mintázathoz. A kulcs ismeretében később ellenőrizhető, hogy a szövegben ott van-e ez a minta.
A szavak apró eltérése más döntésekhez vezethet
A kutatás szerint a módszer hatása nem mindig áll meg a szóválasztásnál. Siposova hat nyílt súlyú modellt vizsgált, és ugyanazokat a káros kéréseket futtatta le vízjellel, illetve vízjel nélkül. A modellek válaszai különösen akkor tértek el, amikor úgynevezett promptinjekciót is alkalmaztak.
A promptinjekció röviden olyan megtévesztő utasítás, amellyel valaki megpróbálja rávenni az AI-t, hogy hagyja figyelmen kívül a korábbi szabályait. Ilyen támadás célja lehet például érzékeny információ megszerzése vagy egy tiltott művelet elérése. A kutató eredményei alapján több vizsgált modellen nőtt annak esélye, hogy a vízjel használata mellett olyan káros kérésre is választ adjanak, amelyet egyébként elutasítottak volna.
A jelenséget a kutató „viselkedési eltolódásnak” nevezi. A magyarázat egyszerűbb, mint a kifejezés: ha a rendszer más apró döntéseket hoz a válasz összeállításakor, az a végeredményben is megjelenhet. Egy AI-nál pedig a végeredmény nem mindig pusztán egy mondat. Ha egy úgynevezett AI-ügynök más eszközöket is elér, a szöveg létrejöttének módja azt is befolyásolhatja, melyik eszközt hívja meg és milyen paraméterekkel.
Nem a Claude működését mérték
Fontos korlát, hogy a vizsgálat nem a Claude-modelleken tesztelte a vízjel hatását. Hat nyílt súlyú modellen futott, mert ezeknél a kutató az összehasonlításhoz változatlanul hagyhatta a többi beállítást, miközben a vízjelezést be- és kikapcsolta. A Hugging Face SynthID-Text-megvalósítását vizsgálta, nem azt a konkrét változatot, amelyet az Anthropic a jövőbeli Claude-modellekhez használhat.
Ez tehát nem bizonyítja, hogy minden vízjelezett chatbot kevésbé biztonságos, és nem állít semmit egy konkrét, már használatban lévő Claude-változat működéséről. A tanulság inkább az, hogy a tartalom eredetének jelölése nem tekinthető pusztán adminisztratív kiegészítésnek: a fejlesztőknek a bevezetés után is tesztelniük kell, hogyan viselkedik a modell normál helyzetben és szándékosan félrevezető utasítások mellett.
A magyar felhasználók számára is ez lehet a gyakorlati következmény: attól, hogy egy AI-szöveg később azonosíthatóvá válik, maga a szolgáltatás nem lesz automatikusan megbízhatóbb minden helyzetben. Az eredetjelölés hasznos eszköz lehet, de a biztonságot továbbra is külön kell ellenőrizni.
Felhasznált források
Ajánló
Tetszett a cikk? Ezt is olvasd el
A TASK#STOMP nevű, PowerShellre épülő kártevő a kutatók szerint üzleti dokumentumokat, vágólapadatokat és Wi‑Fi-jelszavakat is gyűjthet. A fertőzési út nem ismert pontosan, de néhány alapvető ellenőrzés és óvatos lépés sokat számíthat.
Az M6-os egy szakaszának új üzemeltetése körül a 44 és 149 milliárd forintos összegek kerültek szembe egymással. Az MKIF szerint azonban eltérő műszaki követelményeket vetnek össze, ezért a két adat önmagában nem alkalmas közvetlen ár-összehasonlításra.
A BleepingComputer beszámolója szerint a ShinyHunters nevű zsaroló csoport Oracle PeopleSoft-szervereket vesz célba adatlopási támadásokban. Ez nem egy átlagos felhasználói gép ügye: ha a kiszolgálón tárolt adatokhoz hozzáférnek, annak a szervezet és az érintett emberek is megérezhetik a következményeit.