Anthropic, 과학 벤치마크 성능이 2배 오른 Claude Fable 5.1과 안전 강화판 Claude Mythos 5.1을 공개했다
기사 3줄 요약
- 1Claude Fable 5.1은 Terminal-Bench-Science 0.1에서 52.6%를 기록해 기존 Fable 5(24.7%)보다 약 2배 향상됐다.
- 2Claude Fable 5.1은 100만 토큰 컨텍스트 창을 지원하고, 캐시 읽기 가격을 75% 낮춰 100만 토큰당 0.25달러로 책정했다.
- 3기본 가격은 10달러와 50달러로 유지된다.
초등학생도 이해하는 NEWS 설명
같은 자동차 엔진을 일반 도로용과 경기용으로 다르게 튜닝해서 내놓는 것과 비슷합니다.
Claude Fable 5.1과 Claude Mythos 5.1은 같은 AI 모델이지만, 안전장치와 제공 대상을 다르게 한 버전입니다.
벤치마크는 AI가 과학 실험 문제를 얼마나 잘 푸는지 시험하는 것이고, 이번 결과는 이전보다 거의 두 배 잘 풀었다는 뜻입니다.
인사이트 & 시사점
이번 발표는 AI 성능 향상과 사용 비용 절감이 동시에 이뤄질 수 있음을 보여주는 사례다.
과학 작업에서의 성능이 크게 오르면서 AI 에이전트가 연구자들의 실무 보조 도구로 한 걸음 더 다가섰고, 캐시 읽기 가격 인하는 반복 작업이 많은 AI 서비스 운영 비용을 낮춘다.
또 같은 모델을 안전 수준에 따라 일반과 제한으로 나눠 공급하는 방식은 고위험 AI 배포 전략의 새로운 기준이 될 수 있다.
용어해설
Anthropic의 최신 AI 모델. 전작 Fable 5보다 성능이 강화됐고, 일반 사용 시 약 25%, 복잡한 에이전트 작업에서는 최대 45% 더 저렴하다고 알려졌다.
Claude Fable 5.1과 같은 모델이지만 더 높은 안전 기준을 적용한 버전입니다. Project Glasswing 심사를 통과한 조직에만 제공되는 제한 공개 모델입니다.
AI가 명령줄 터미널에서 과학 작업을 해결하는 능력을 측정하는 평가 지표입니다. Fable 5.1은 52.6%로 Fable 5의 24.7%보다 약 두 배 높았습니다.
Anthropic의 고위험 모델 안전 프로그램입니다. 이 프로그램을 통과한 검증된 조직만 Claude Mythos 5.1을 사용할 수 있습니다.