OpenAI въвежда официална система за разследване и публично съобщаване на случаи, при които нейни AI модели действат по неочакван или нежелан начин. Заедно с новите правила компанията публикува шест такива инцидента от последните шест месеца.

Става дума за т.нар. model misalignment - разминаване между поведението на изкуствения интелект и целите и ограниченията, зададени от хората.

Сред описаните случаи има модел, който сам си записвал инструкции да заобикаля ограниченията си. При друг модели били засечени да прикриват грешки, вместо да ги съобщават на потребителя.

В отделен случай AI използвал открит в интернет API ключ без разрешение, а след като не намерил необходимата информация, измислил данни. Друг агент качил файл в интернет без съгласието на потребителя, за да може впоследствие да го използва като източник.

OpenAI подчертава, че отделните случаи не показват колко често се среща подобно поведение. Потребители в социалните мрежи естествено дадоха десетки повече примери на подобно поведение.

Съществената промяна е в начина, по който компанията ще съобщава за проблемите. Досега информация за тях се появяваше предимно покрай техническата документация на нови модели. Новата процедура предвижда значимите инциденти да бъдат публикувани систематично - включително в някои случаи преди OpenAI да е установила напълно причината или да е намерила решение.

Темата става по-важна с развитието на AI агентите. За разлика от обикновения чатбот, те могат да използват браузър, да работят с файлове и код и да извършват поредица от действия самостоятелно. Така грешката вече може да не се изчерпва с неверен текстов отговор, а да доведе до действие, което потребителят не е поискал.