Bugcrowd가 카네기멜론대학교 연구진 등과 협력하여 출시한 취약점 공격 평가 벤치마크 'ExploitBench' 테스트 결과, Anthropic의 Claude Mythos가 OpenAI의 GPT-5.5보다 실제 구글 크롬 취약점 공격 능력에서 더 높은 성과를 기록했습니다. Mythos는 41개 취약점 중 21개에서 최고 단계를 달성하며 평균 9.90점을 기록한 반면, GPT-5.5는 평균 5.51점과 2개 사례에서만 최고 단계에 도달했습니다. Bugcrowd의 데이비드 브럼리는 Mythos가 크롬의 1일(One-day) 취약점을 약 50%의 확률로 공격할 수 있으며 최고 수준의 해커조차 놓친 공격 해법을 찾아냈다고 설명했습니다.
원문 보기 →