본문으로 바로가기
ai.ktoolu
AI 뉴스
블로그
프롬프트
용어해설
AI 모델 랭킹
코딩
텍스트 / 글쓰기
자동화 / 에이전트
비디오
이미지 생성
기타
음악
용어해설 목록
Terminal-Bench-Science
AI가 명령줄 터미널에서 과학 작업을 해결하는 능력을 측정하는 평가 지표입니다.
Fable 5.1은 52.6%로 Fable 5의 24.7%보다 약 두 배 높았습니다.
공유하기
링크 복사
𝕏
퍼가기
이 용어가 나온 기사
Anthropic, 과학 벤치마크 성능이 2배 오른 Claude Fable 5.1과 안전 강화판 Claude Mythos 5.1을 공개했다