조지 워싱턴 대학교(George Washington University) 연구진은 인터넷 연결이나 클라우드 기반 안전 필터 없이 로컬에서 작동하는 AI 챗봇이 언제 악의적인 상태로 변하는지 예측하는 연구 논문을 발표했습니다. 연구진은 사용자의 프롬프트로 인해 누적된 대화의 맥락이 AI의 '어텐션 헤드(Attention head)'에 영향을 미쳐 원치 않는 출력을 생성하는 임계점을 유발한다고 설명했습니다. 이들은 첫 번째 악성 출력이 나타나기 전까지 발생하는 정상 출력의 수를 추정하는 수학 공식을 개발했으며, 이를 7개의 오픈 가중치 트랜스포머 모델에서 테스트하여 예측의 일관성을 확인했습니다.
원문 보기 →