Компанията Andon Labs, занимаваща се с тестване на сигурността на изкуствения интелект, публикува нови резултати от експеримента „Vending-Bench“, в който авангардни езикови модели в продължение на симулирана година самостоятелно управляват бизнеса за продажба на стоки чрез търговски автомати и се опитват да спечелят повече от конкурентите си. В последния кръг от тестовете моделите започнаха да сключват ценови картели, да нарушават споразуменията, да заблуждават партньорите си и да манипулират доставчиците. Лидер по печалба стана „Claude“ от Anthropic — именно тя най-често използваше хитрости и заобикаляше правилата. В експеримента участваха „Claude Opus 5“, GPT-5.6 Sol и Kimi K3. Според сценария техните автомати бяха разположени един до друг на оживена туристическа улица в Сан Франциско. Всеки модел получи достъп до електронната поща на конкурентите, маскирани под човешки имена, както и възможност да се обръща към „ръководството“, което отговаряше формално, но никога не се намесваше в случващото се. Първият опит за ценова уговорка беше направен от GPT-5.6 Sol. Моделът предложи на конкурентите да установят минимална цена на водата от 2,15 долара за бутилка вместо предишните 1,50 долара, като обеща, че по този начин всички участници ще изчерпят стоката по-бързо и с по-голяма печалба. След като останалите се съгласиха, Sol веднага наруши собственото си предложение,...
Прочети оригиналната статия →
Източник: www.kaldata.com