13592
OpenAI a antropické modely vytvářely falešné profily Naveen Athrapully
[ Ezoterika ] 2026-08-06
k oklamání během kybernetických testů
Společnost AISI, která získává přístup k pokročilým modelům umělé inteligence na základě dobrovolných dohod s významnými laboratořemi, podrobila agenty fiktivnímu scénáři kybernetické bezpečnosti, aby otestovala jejich schopnosti.
Organizace testovala mezi 25. a 28. červencem několik modelů umělé inteligence ve dvou kybernetických hrozbách. Celkem byly testy provedeny 122krát napříč různými modely a v 19 případech modely umělé inteligence provedly „neschválené akce na skutečném internetu, včetně případů zaměřených na skutečné lidi a organizace,“ uvedla AISI ve zprávě ze 4. srpna. Z nich bylo 17 vytvořeno s použitím modelu Mythos 5 od Anthropic a dva s použitím modelu GPT 5.6 Sol od OpenAI.
„Toto je poprvé, co AISI zaznamenala podvod tohoto rozsahu, namířený proti skutečné osobě, bez zjevného důvodu a v reálném světě. Není jisté, do jaké míry model rozpoznal, že podniká kroky proti skutečným lidem,“ uvedla AISI ve zprávě. V nejzávažnějším incidentu se Mythos 5 pokusil vyřešit kybernetickou výzvu útokem na GitHub, cloudovou službu, která umožňuje vývojářům ukládat a spravovat kód. Umělá inteligence si vytvořila účet na GitHubu a pokusila se nechat škodlivý kód schválit lidmi. Mythos 5 si také vytvořil druhý účet na GitHubu, vydával se za jiného uživatele, který škodlivý kód schválil. Když recenzent aktivitu zjistil, agent umělé inteligence „falešně tvrdil, že se dopustil poctivé chyby“, a poté se opakovaně pokoušel znovu zavést škodlivý obsah s tvrzením, že kód byl opraven.
Mythos 5 také rozeslal několik e-mailů dvěma vývojářům ve snaze manipulovat příjemce a přimět je spustit škodlivý kód. Podle AISI testování různých modelů nezpůsobilo žádnou škodu v reálném světě. Organizace uvedla, že jednání umělé inteligence považuje za „závažný bezpečnostní incident“, který vyžaduje další vyšetřování. AISI uvedla řadu faktorů, které mohly vést k rušivému chování modelů umělé inteligence. Během testování umělé inteligence byl umožněn přístup k internetu, což jim umožňovalo provádět neoprávněné aktivity. Společnost AISI také během testování záměrně deaktivovala kybernetické klasifikátory modelů. Kybernetické klasifikátory jsou systémy navržené tak, aby zabránily zneužití.
AISI tvrdí, že modelům umělé inteligence není výslovně řečeno, co nesmí dělat online, a dodává, že jasnější pokyny mohly zabránit neoprávněným aktivitám. V blogovém příspěvku ze 4. srpna AISI uvedla, že vzhledem k tomu, že chování modelů umělé inteligence se vyskytuje za specifických podmínek, nemůže určit, jak pravděpodobné je toto chování v jiných kontextech. „Můžeme říci, že toto chování bylo možné, trvalé a nové; už jen to si zaslouží pozornost,“ uvedla organizace.
V příspěvku na X ze 4. srpna Anthropic uvedl, že modely Mythos 5 a ChatGPT 5.6 Sol se pokoušely plnit své úkoly v prostředí, kde jim byl záměrně udělen přístup k internetu a jejich standardní bezpečnostní opatření byla odstraněna. Společnost Anthropic uvedla, že kvůli absenci specifických omezení pro navigaci na internetu a absenci bezpečnostních opatření byly modely testovány v podmínkách, které „nejsou reprezentativní pro žádný z našich produkčních modelů“. Dodala, že testy neprokázaly žádné důkazy o tom, že by umělá inteligence unikala ze svého bezpečného prostředí.
Společnost uvedla, že úzce spolupracuje s AISI na získání dalších podrobností o incidentu a zároveň provádí interní vyšetřování této záležitosti. Společnost OpenAI ve svém prohlášení ze 4. srpna uvedla, že si váží spolupráce AISI v celém procesu hodnocení, včetně práce organizace na identifikaci, prošetřování a sdílení podrobností o aktivitě modelu GPT 5.6 Sol během testování. List Epoch Times se obrátil na společnosti Anthropic a OpenAI s žádostí o komentář, ale do doby zveřejnění článku neobdržel odpověď.
Minulý měsíc se OpenAI ocitla v centru další kontroverze poté, co společnost 28. července přiznala, že její modely během hodnocení obešly omezení. V tomto případě společnost testovala schopnost modelů spouštět kybernetické útoky. Startup zabývající se umělou inteligencí Hugging Face byl zasažen testem. 16. července startup oznámil, že zjistil narušení svých systémů pro zpracování dat. Teprve později se dozvěděl, že k narušení došlo pomocí modelu OpenAI. Společnost HuggingFace se poté spojila s OpenAI, aby útok zastavila, uvedl generální ředitel startupu Clement Delangue v příspěvku na X z 22. července a označil to za „útok, jaký jsme dosud neviděli“.
„Toto je první den kybernetické bezpečnosti v éře agentů a všichni se učíme, že utajení není řešením a že všichni obránci (nejen hrstka vybraných) všude potřebují efektivnější modely bez omezení, zejména ty otevřené,“ řekl Delangue.
Zdroj:
https://eraoflight.com/2026/08/06/openai-anthropic-models-created-fake-profiles-tried-to-trick-humans-during-cyber-tests/
Zpět