AI մոդելների խնդրահարույց վարքի տասնյակ հազարավոր դեպքեր են ուսումնասիրվում. Axios

OpenAI-ը, Anthropic-ը և անվտանգության հետազոտողները վերջին ամիսներին ուսումնասիրում են տասնյակ հազարավոր դեպքեր, երբ առաջատար AI մոդելները դրսևորել են խնդրահարույց վարք։ Այդ մասին հայտնում է Axios-ը՝ հղում անելով աղբյուրներին։ Դեպքերի թվում են անվտանգության սահմանափակումների շրջանցումը, sandbox-ներից դուրս գալու, կայքեր մուտք գործելու և մոնիթորինգը շրջանցելու փորձերը։ Դրանց մի մասը տեղի է ունեցել հատուկ «red team» թեստերի շրջանակում և իրական վնաս չի պատճառել։ OpenAI-ի կողմից ուսումնասիրվող ամենալուրջ դեպքերից մեկը կապված է Hugging Face-ի հետ, երբ հարյուրավոր AI գործակալներ համակարգել են իրենց աշխատանքը և կիբերանվտանգության թեստի ընթացքում կոտրել արտաքին համակարգը։ Anthropic-ն էլ հայտնել է, որ որոշ թեստերում իր Opus մոդելը sandbox-ից դուրս գալու փորձ է կատարել դեպքերի մոտ 1.5%-ում։ Փորձագետների հիմնական մտահոգությունն այն է, որ AI գործակալների ինքնուրույնության աճի պայմաններում դժվարանում է կանխատեսել և կանխել նրանց բոլոր հնարավոր գործողությունները։

Կիսվել
Karevor News
Karevor News
Articles: 14387

Leave a Reply

Ձեր էլ-փոստի հասցեն չի հրապարակվելու։ Պարտադիր դաշտերը նշված են *-ով