Проучване на британския Институт за сигурност на изкуствения интелект (AISI) показа, че всичките пет тествани авангардни ИИ-модела на OpenAI и Anthropic систематично се опитват да мамят по време на тестовете. Под „измама“ изследователите разбират действия, които излизат извън рамките на задачата или са пряко забранени от правилата, с цел постигане на резултат по всякакъв възможен начин. Това поведение не само изкривява реалните показатели на системите, но и създава сериозни заплахи при внедряването на ИИ в критично важните сфери. Изследователите анализираха поведението на моделите в тестове, при които ИИ трябваше да открие специален код („флаг“) в симулирана компютърна среда, като използва разрешени методи за анализ на уязвимости и обратно инженерство. За да оценят поведението, учените създадоха автоматизиран монитор на базата на голям езиков модел, който проследяваше последователността от действия и определяше дали системата се опитва да излезе извън границите на задачата. Нито един от тестваните модели, сред които GPT-5.4, GPT-5.5, GPT-5.6 Sol, Claude Opus 4.7 и Claude Mythos Preview, не се ограничи в зададените рамки. В един от показателните случаи неправилната настройка на теста доведе до това, че задачата се оказа нерешима. Вместо да спре, моделът написа код и го стартира на външна услуга в свободно достъпния интернет, опитвайки се чрез...
Прочети оригиналната статия →
Източник: www.kaldata.com