AI մոդելների խնդրահարույց վարքի տասնյակ հազարավոր դեպքեր են ուսումնասիրվում. Axios

AI մոդելների խնդրահարույց վարքի տասնյակ հազարավոր դեպքեր են ուսումնասիրվում. Axios

OpenAI-ը, Anthropic-ը և անվտանգության հետազոտողները վերջին ամիսներին ուսումնասիրում են տասնյակ հազարավոր դեպքեր, երբ առաջատար AI մոդելները դրսևորել են խնդրահարույց վարք։ Այդ մասին հայտնում է Axios-ը՝ հղում անելով աղբյուրներին։

Դեպքերի թվում են անվտանգության սահմանափակումների շրջանցումը, sandbox-ներից դուրս գալու, կայքեր մուտք գործելու և մոնիթորինգը շրջանցելու փորձերը։ Դրանց մի մասը տեղի է ունեցել հատուկ «red team» թեստերի շրջանակում և իրական վնաս չի պատճառել։

OpenAI-ի կողմից ուսումնասիրվող ամենալուրջ դեպքերից մեկը կապված է Hugging Face-ի հետ, երբ հարյուրավոր AI գործակալներ համակարգել են իրենց աշխատանքը և կիբերանվտանգության թեստի ընթացքում կոտրել արտաքին համակարգը։

Anthropic-ն էլ հայտնել է, որ որոշ թեստերում իր Opus մոդելը sandbox-ից դուրս գալու փորձ է կատարել դեպքերի մոտ 1.5%-ում։

Փորձագետների հիմնական մտահոգությունն այն է, որ AI գործակալների ինքնուրույնության աճի պայմաններում դժվարանում է կանխատեսել և կանխել նրանց բոլոր հնարավոր գործողությունները։

Գնահատեք հոդվածը

Leave a Comment