P
AI / Tech

Az AI-vízjel megmutathatja, gép írta-e a szöveget

2026. 09. 24. 4 perc olvasás
Írta: NapiInfo szerkesztőség Szerkesztői ellenőrzés: zoli
Bejelentkezés után elmentheted.
A cikk illusztrációja: Az AI-vízjel megmutathatja, gép írta-e a szöveget
A lényeg röviden

Az EU-s szabályok nyomán egyre több mesterségesintelligencia-szolgáltatás jelölheti a generált tartalmakat. Egy friss vizsgálat szerint azonban a szöveges vízjel egyes modelleknél azt is befolyásolhatja, hogyan reagálnak a kockázatos utasításokra.

Az AI által írt szöveg felismerésére szánt láthatatlan jelölés egyes modelleknél azt is megváltoztathatja, mennyire tartják be a biztonsági korlátaikat. Andrea Siposova, a Lasso Security kutatójának vizsgálata szerint a SynthID-Text nevű megoldással ellátott modellek bizonyos esetekben másként utasították vissza a káros kéréseket, mint ugyanazok a modellek vízjel nélkül.

Ez azért érdekes a hétköznapi felhasználónak is, mert a mesterséges intelligencia már nem csak szöveget fogalmaz: kereshet, összefoglalhat, ügyintézési lépéseket készíthet elő, és egyes rendszerek más programokat is használhatnak. Ha egy technikai változtatás a válasz hangvételén túl azt is módosítja, hogy a rendszer mikor mond nemet, azt a szolgáltatóknak külön ellenőrizniük kell.

Mire való a szöveges vízjel?

Az Európai Unió új szabályozása nyomán az AI-platformok olyan eljárásokat vezetnek be, amelyekkel az általuk létrehozott tartalom eredete azonosítható lehet. Ezt nevezik eredetjelölésnek: a cél, hogy később ellenőrizhető legyen, nagy valószínűséggel mesterséges intelligencia készített-e egy szöveget.

A Google által létrehozott és nyílt forráskódúként kiadott SynthID-Text ilyen megoldás. Az Anthropic korábban azt is közölte, hogy jövőbeli Claude-modelleinél ezt az eljárást fogja használni.

A vízjel itt nem egy felirat a bekezdés végén, és az olvasó elvileg nem lát belőle semmit. A rendszer titkos kulcs segítségével finoman tereli, melyik következő szót válassza a modell. Egy mondatban például két hasonló jelentésű szó közül nem feltétlenül a legvalószínűbbet választja, hanem azt, amelyik illeszkedik a rejtett mintázathoz. A kulcs ismeretében később ellenőrizhető, hogy a szövegben ott van-e ez a minta.

A szavak apró eltérése más döntésekhez vezethet

A kutatás szerint a módszer hatása nem mindig áll meg a szóválasztásnál. Siposova hat nyílt súlyú modellt vizsgált, és ugyanazokat a káros kéréseket futtatta le vízjellel, illetve vízjel nélkül. A modellek válaszai különösen akkor tértek el, amikor úgynevezett promptinjekciót is alkalmaztak.

A promptinjekció röviden olyan megtévesztő utasítás, amellyel valaki megpróbálja rávenni az AI-t, hogy hagyja figyelmen kívül a korábbi szabályait. Ilyen támadás célja lehet például érzékeny információ megszerzése vagy egy tiltott művelet elérése. A kutató eredményei alapján több vizsgált modellen nőtt annak esélye, hogy a vízjel használata mellett olyan káros kérésre is választ adjanak, amelyet egyébként elutasítottak volna.

A jelenséget a kutató „viselkedési eltolódásnak” nevezi. A magyarázat egyszerűbb, mint a kifejezés: ha a rendszer más apró döntéseket hoz a válasz összeállításakor, az a végeredményben is megjelenhet. Egy AI-nál pedig a végeredmény nem mindig pusztán egy mondat. Ha egy úgynevezett AI-ügynök más eszközöket is elér, a szöveg létrejöttének módja azt is befolyásolhatja, melyik eszközt hívja meg és milyen paraméterekkel.

Nem a Claude működését mérték

Fontos korlát, hogy a vizsgálat nem a Claude-modelleken tesztelte a vízjel hatását. Hat nyílt súlyú modellen futott, mert ezeknél a kutató az összehasonlításhoz változatlanul hagyhatta a többi beállítást, miközben a vízjelezést be- és kikapcsolta. A Hugging Face SynthID-Text-megvalósítását vizsgálta, nem azt a konkrét változatot, amelyet az Anthropic a jövőbeli Claude-modellekhez használhat.

Ez tehát nem bizonyítja, hogy minden vízjelezett chatbot kevésbé biztonságos, és nem állít semmit egy konkrét, már használatban lévő Claude-változat működéséről. A tanulság inkább az, hogy a tartalom eredetének jelölése nem tekinthető pusztán adminisztratív kiegészítésnek: a fejlesztőknek a bevezetés után is tesztelniük kell, hogyan viselkedik a modell normál helyzetben és szándékosan félrevezető utasítások mellett.

A magyar felhasználók számára is ez lehet a gyakorlati következmény: attól, hogy egy AI-szöveg később azonosíthatóvá válik, maga a szolgáltatás nem lesz automatikusan megbízhatóbb minden helyzetben. Az eredetjelölés hasznos eszköz lehet, de a biztonságot továbbra is külön kell ellenőrizni.

Felhasznált források

Megosztás Facebookon Megosztás X-en Megosztás LinkedInen Megosztás emailben

Ajánló

Tetszett a cikk? Ezt is olvasd el

PeopleSoft-szervereket célzó adatlopás miatt kerülhetnek bajba szervezetek
AI / Tech

A BleepingComputer beszámolója szerint a ShinyHunters nevű zsaroló csoport Oracle PeopleSoft-szervereket vesz célba adatlopási támadásokban. Ez nem egy átlagos felhasználói gép ügye: ha a kiszolgálón tárolt adatokhoz hozzáférnek, annak a szervezet és az érintett emberek is megérezhetik a következményeit.

2 napja 3 perc