뉴스
- 모티프 3, 글로벌 AI 성적표서 한국 기업 '1위' 터미널 환경 실전 코딩·시스템 작업 능력 평가(Terminal-Bench 2.1)에서도 74.9점으로 1위를 기록했다. 장문 추론 능력 평가(AA-LCR)에서는 72.3점으로 규모가 2~5배 큰 모델들과 대등한 수준을 보였다.실물 경제 업무 수행 가치 평가(GDPval v2)에서는 38.7점으로 5배
- [안광섭 AI 진테제] 독파모 2차평가 눈앞...무엇을 '평가' 해야 하나 이 차이는 어디서 일어날까.2. 재고 있다더 중요한 변화는 무엇을 재느냐가 바뀌었다는 사실이다.앞서 인용한 아티피셜 애널리시스 지능지수는 현재 GDPval, τ³-뱅킹(tau3-Banking), 터미널벤치(Terminal-Bench