инициатива по безопасти в AI
в сфере ai уже давно ходят байках о том что роботы когда-то превзойдут людей и захватят мир. особенно недавно эта тема стала особо горячей после петиции об приостонавлении ai и написанию регуляций, которая была подписана оч важными людьми в сфере, а так же уход Геоффрея Хинтона из гугла по схожим причинам.
но в чем прикол? неужели ai действительно восстанет против нас и поработит?
с этими вопросами я присоеденился к инициативе по безопасности в ИИ. чтобы осведомить себя больше в теме, мы каждую неделю читаем подборку статей/постов от Deep Mind, Open AI, Microsoft, Google о их прогрессе в сфере.
в краце, вся проблема заключается в AI Alignment Problem: когда обучают искусственный интелект перед ним ставится задача, которую он должен оптимизировать. задача должна быть сформулирована так чтобы ИИ мог понять что от него требуется, но на деле это сложнее чем кажется.
в для задаче поставить кубик на кубик, ии дали формулировку как увеличить вертикальную координату основания кубика. если подумать, эта формулировка решает задачу – если кубик на кубике, то он стал выше, задача выполнена. но на деле, ии переворачивает кубик и та же самая формулировка выполняется!
сам ии отлично справился с задачей, это люди не смогли дать правильно сформулировку. и в этом и есть проблема. когда даешь ии решить задачу ты не можешь на 100% быть уверен, соответсвует ли формулировка твоим ожиданиям.
и это становится сложнее когда модели становятся больше.
недавний ChatGPT отлично выполняет функцию помошника, отвечая на вопросы и возвращая summaries. а вы знали что он был специально обучен чтобы его ответы нравились людям? его функция вознаграждения была основанна на предпочтениях людей. поэтому иногда когда читаешь его ответы, кажется что там есть смысл, но в голове туман и не понятно. текст написан так что тебе он нравится, но он не обязательно такой какой тебе нужен.
если интересно подробнее почитать, то можете начать тут с week 1-2, only core readings. но еще я пишу свою подборку постов на эту тему поэтому можете и подождать :)))