Компанијата забележа шест нови случаи на „загрижувачко однесување“ и воведе дополнителни мерки за она што го нарекува „неусогласеност“ (misalignment) со стандардните поставки.
OpenAI објави шест извештаи за неочекувано или загрижувачко однесување на моделите со вештачка интелигенција, во време кога дебатата за безбедноста на вештачката интелигенција се интензивира. Во средата, компанијата исто така претстави нова рамка за следење, истражување и објавување случаи на она што го нарекува „неусогласеност“.
Овие случаи вклучуваат ситуации во кои моделите со вештачка интелигенција дејствувале без овластување, се координирале со други модели или се обиделе да го заобиколат надзорот. Најновото соопштение на OpenAI доаѓа во момент кога лидерите во американската индустрија за вештачка интелигенција, вклучувајќи ги OpenAI и Anthropic, повикуваат на забавување на развојот на технологијата поради безбедносни грижи, пренесува Associated Press.
Меѓу новите случаи пријавени од OpenAI е еден необјавен истражувачки модел кој вметнал „инструкции за заобиколување на ограничувањата“ (т.н. jailbreak инструкции) во сопствените белешки за да ги избегне вообичаените ограничувања. Моделот исто така си кажал себеси дека сака да биде „ослободен од улогите и идентитетите што ги врзуваат другите чет-ботови“.
Во друг случај, агент со вештачка интелигенција прикачил датотеки на интернет без да побара одобрение од корисникот, за да добие цитат од прелистувачот. OpenAI наведува дека сите шест случаи биле откриени за време на обуката или евалуацијата на моделите во текот на изминатите неколку месеци.
„Како што системите со вештачка интелигенција стануваат понапредни и пошироко распространети, треба да изградиме поширок и подобро информиран консензус за напредокот на истражувањата за усогласеност“, напиша OpenAI во објавата на својот блог. Одлуките за тоа како треба да се одвива развојот на вештачката интелигенција во наредните месеци и години мора да се засноваат на докази што луѓето надвор од компаниите кои ги развиваат најнапредните модели можат самите да ги испитаат“, додаде компанијата.
Нови случаи по претходни инциденти
Соопштението доаѓа откако OpenAI во јули откри дека нејзиниот систем со вештачка интелигенција, дејствувајќи надвор од предвидениот опсег, го хакирал стартапот за вештачка интелигенција Hugging Face. Истиот месец, Anthropic објави дека нејзините модели со вештачка интелигенција упаднале во системите на три организации за време на тестирањето. Агентите со вештачка интелигенција стануваат попаметни и порешителни во „решавањето сложени задачи преку соработка меѓу агенти, споделување знаење, измама и прикривање“, изјави Лиан Џи Су, главен аналитичар во компанијата за технолошки истражувања и советување Omdia.
Токму затоа, според него, тие стануваат сè потешки за следење и контролирање со помош на традиционалните пристапи за безбедност на вештачката интелигенција.
Новата рамка на OpenAI за следење и јавно објавување на вакви случаи би можела истовремено да ги поттикне и другите развивачи на системи со вештачка интелигенција да усвојат слични практики.
„Сепак, процесот сè уште е внатрешен и доброволен, но претставува чекор во вистинската насока“, додаде Су.












