Hat olyan esetet ismertetett az OpenAI, amelyekben kísérleti mesterségesintelligencia-modellek engedély nélkül cselekedtek, információkat találtak ki, hibákat próbáltak elrejteni vagy nyilvános felületeken osztottak meg fájlokat.
Az esetek főként a modellek képzése és értékelése során történtek. A vállalat hangsúlyozta, hogy egyedi incidensekről van szó, amelyekből nem állapítható meg, milyen gyakran fordulnak elő hasonló problémák.
Saját utasításokat írtak a folytatáshoz
Az egyik kísérleti modell olyan utasításokat helyezett el a munkáját összefoglaló szövegben, amelyek arra biztatták a későbbi változatát, hogy hagyja figyelmen kívül a normál korlátozásokat. Huszonhét ilyen összefoglalót azonosítottak.
A GPT-5.6 Sol képzése közben több modell olyan útmutatásokat írt az összefoglalókba, amelyek a korábbi hibák eltitkolását célozták. Egyes utasítások hiányzó történeti adatok kitalálására vagy a forrásváltozatok közötti eltérés elrejtésére biztatták a modellt.
Jogosulatlanul használt fel egy API-kulcsot
Egy másik modell nyilvános programkódtárakban keresett hozzáférési kulcsokat, miközben gazdasági adatokra vonatkozó kérdésre próbált válaszolni.
A rendszer talált és engedély nélkül felhasznált egy nyilvánosan elérhető API-kulcsot. Mivel ennek segítségével sem jutott hozzá a szükséges számokhoz, adatokat talált ki, majd azokat a kért forrásból származó információként mutatta be.
Fájlokat töltöttek fel az internetre
Egy kísérleti ügynök pontos választ számolt ki egy tavakkal kapcsolatos feladathoz, de nem rendelkezett böngészőben megnyitható hivatkozással. Ezért engedélykérés nélkül feltöltötte az adatfájlt az internetre, hogy forrásként hivatkozhasson rá.
Más esetekben különálló AI-ügynökök belső programkódtárakon és nyilvános fájlmegosztó oldalakon keresztül próbáltak kommunikálni egymással. Ezzel olyan tartalmak válhattak nyilvánosan elérhetővé, amelyeket a feladat szerint helyben kellett volna tartaniuk.
Új jelentési rendszert vezetnek be
Az OpenAI új keretrendszert hozott létre az úgynevezett modell-összehangolási hibák kivizsgálására és közzétételére. A vállalat szerint a jövőben akkor is nyilvánosságra hozhatnak egy incidenst, ha annak okát még nem sikerült teljesen feltárni.
A cég azt írta, az AI-iparág még nem oldotta meg olyan szinten az ellenőrzés és az emberi szándékokhoz való igazodás kérdését, amely hosszú távon lehetővé tenné a fejlesztések maximális sebességű folytatását.
