뉴스
-
벤치마크 1위 모티프는 왜 탈락했나…'독파모' 세부 점수 까보니
[서울=뉴시스]심지혜 기자 = ‘독자 인공지능(AI) 파운데이션 모델 프로젝트(독파모)’ 2차 단계평가에서 SK텔레콤이 70.6점으로 종합 1위를 차지했다. 업스테이지가 69.9점으로 2위, LG AI연구원이 69.0점으로 3위를 기록했으며 모티프테크놀로지스는 65.8점으로 4위에 머물
www.newsis.com · 2026.08.27
-
벤치마크 1위인데 ‘국가대표 AI’ 2차 탈락… 모티프, 점수 공개 요구
2차 평가에서 탈락한 AI 스타트업 모티프테크놀로지스(모티프)가 평가 결과에 공식 이의를 제기했다. 1차 평가에서 모델 ‘독자성’ 논란이 불거진 데 이어 2차에서는 평가 기준과 점수 정부가 대규모 AI 지원 사업을 여럿 추진하는 만큼 평가 기준과 선정 근거를 더 투명하게 공개해야 한다는 목소리가 커지고 있다.● 글로벌 벤치마크 1위가 탈락… 점수 공개 논란모티프는
www.donga.com · 2026.08.27
-
[안광섭 AI 진테제] 벤치마크 점수 3점에 30배 비용 내야하나
[지디넷코리아]7월 중순부터 8월 초까지 3주 사이에 중국 AI 진영에서 세 건의 주목할만한 발표가 연달아 나왔다. 문샷AI가 2조8000억 파라미터 규모의 키미 K3를 내놓고 열흘 뒤 가중치를 공개했다. 딥시크는 7월 31일 V4 플래시를 갱신했다. 알리바바는 8월 3일 2조4000억
zdnet.co.kr · 2026.08.04
-
[비욘드IT] 돈으로 사는 벤치마크 점수…AI 성능평가 공정성 우려
성능에 대한 직관적인 지표를 제공하는 만큼 주요 AI 기업 신규 모델을 선보이며 벤치마크 점수를 공개하며 고객사도 벤치마크 점수를 모델 선택 핵심 기준으로 활용한다.문제는 벤치마크가 취지로 언급해 논란이 커졌다.한 업계 관계자는 "벤치마크 데이터를 대거 사들여 학습시키면 벤치마크 점수를 높일 수는 있겠지만 실제 업무에 적용해 활용하는 건 다른 이야기"라며 "깃허브나
zdnet.co.kr · 2026.07.10
-
독파모 2차전 '모티프' 탈락…업스테이지·SKT·LG 진출
강조했다.벤치마크 평가는 AAII 벤치마크 평가(25점)와 NIA 벤치마크 평가(15점)로 구성됐다. 벤치마크 평가(40점) 4개 정예팀 전체 평균은 22.5점이며, 1위와 4위 간 점수 격차는 4.0점이다.전문가 평가는 외부 AI전문가로 구성된 전문가위원회를 구성해 정예팀이 제출한
zdnet.co.kr · 2026.08.18
-
'국가대표 AI' 누가 될까…LG·SKT·업스테이지 생존, 모티프 탈락
진출했습니다.과학기술정보통신부는 벤치마크·전문가·사용자 평가를 종합한 이번 2차 평가에서 모티프테크놀로지스가 최하위를 기록해 탈락했다고 오늘(18일) 밝혔습니다.평가 항목별로 보면 배점 40점인 벤치마크 평가에서 4개 팀 전체 평균은 22.5점이었고 1위와 4위 간 점수 격차는 4.0점이었습니다.배점 35점인 전문가 평가 전체 평균은 28.8점으로 1·4위 격차는 2.4점, 배점
www.mbn.co.kr · 2026.08.18
-
[독파모 2차 발표] 예정대로 2곳 선정…AI 개발 지원책은 재검토
항목별 4개 팀의 점수 차이가 크지 않은 상황에서 개별 순위를 공개할 실익이 크지 않은 데다 나머지 기업에 미칠 영향도 고려했다는 설명이다.2차 평가 결과에 따르면 벤치마크 평가에서 사용자 평가에서 4개 정예팀 전체 평균은 17.6점이며 1위와 4위 간 점수 격차는 5.0점이었다.다만 모티프테크놀로지스는 AAII 기준 높은 벤치마크 성능에도 불구하고 사용성·활용성
zdnet.co.kr · 2026.08.18
-
오픈AI·딥마인드가 짚은 벤치마크 함정, AI 승부는 '현장'서 갈린다
반면 업스테이지·SK텔레콤·LG AI연구원이 3차에 진출했다.이번 평가는 벤치마크 40점, 전문가 평가 35점, 사용자 평가 25점 등 총 100점으로 진행했다. 오픈AI의 추론 모델 'o1'과 'o3' 시리즈를 설계한 그는 벤치마크 점수 하나가 아니라 연산량 대비 성능 곡선으로 모델을 평가해야 한다고 지적했다.
zdnet.co.kr · 2026.08.19
-
[현장] 오픈AI "AI 벤치마크 한계…토큰·비용·시간까지 고려해야"
[지디넷코리아]인공지능(AI) 모델 평가를 단일 벤치마크 점수 중심으로 보는 방식에 한계가 있다는 주장이 나왔다. 브라운 부사장은 최근 AI 모델 실제 성능이 기존 벤치마크 점수만으로는 충분히 드러나지 않는다고 봤다.
zdnet.co.kr · 2026.07.03
-
카카오, Kanana-2 안전성 결과 공개…글로벌 최고 수준
이번 평가에는 과학기술정보통신부 사업의 일환으로 한국정보통신기술협회(TTA), KAIST, 카카오 등이 지난해 11월 공동 구축한 한국어 특화 안전성 벤치마크 'AssurAI'가 활용됐다 Kanana-2-1.3B-Instruct는 종합 점수 0.70을 기록해 Gemma(0.68), Qwen(0.58)을 앞섰으며, Kanana-2-3B-Instruct 역시 0.70으로
www.nocutnews.co.kr · 2026.08.18
뉴스 결과 더보기 →
블로그
-
'GPT를 이겼다'는 그 AI 점수, 믿어도 되나 — 벤치마크 똑바로 읽는 법
"X가 GPT를 이겼다" — 그 점수, 믿어도 되나? 환각 글이 '평가 방식이 AI를 망친다'로 끝났으니, 오늘은 그 '평가(벤치마크)' 자체를 해부함. - 정의: benchmark(벤치마크)는 여러 AI를 같은 시험지로 채점해 줄 세우는
blog.naver.com · 2026.06.15
-
AI 성능 경쟁의 그늘..'벤치맥싱' 뭘까?
테크톡노트] AI 성능 경쟁의 그늘…'벤치맥싱' 뭐길래 송고2026-08-15 10:00 송고 2026년08월15일 10시00분 구글에서 선호하는 출처로 추가 권하영기자 리더보드 점수 벤치마크가 AI 모델의 능력을 가늠하는 핵심 척도로 자리 잡으면서, 점수.......
blog.naver.com · 2026.08.15
-
구글 텐서 G6 성능 (벤치마크) 살펴보기, 가격과 성능은 비례하지않는다
가격대비 성능을 고려하지않고, 게임도 전혀 하지않는다면 픽셀11 프로를 구매해도 괜찮을 것 같아요 텐서 G6 벤치마크 점수 정리, 엑시노스 미만 픽셀11 프로는 전작인 픽셀 10 프로대비
blog.naver.com · 2026.08.22
-
카카오, 경량 언어모델 Kanana-2 시리즈 안전성 평가 결과 공개 글로벌 모델 대비 최고 수준 기록
유사 파라미터 규모의 구글 Gemma, 알리바바 Qwen 평가 기준 (AssurAI): 과기정통부 사업 일환으로 TTA, KAIST, 카카오 등이 구축한 한국어 특화 AI 안전성 벤치마크 평가 결과 점수 1.3B 모델: 0.70점 (Gemma 0.68, Qwen 0.58 상회) 3B 모델.......
blog.naver.com · 2026.08.18
-
"GPU 2장 구동 vs NPU 풀스택"…8월 '국가대표 AI' 2차 평가, 승부처는 에이전트와 가성비("벤치마크 거품 빼고 실무형 AI로")
다음 달(8월) 진행되는 2차 평가는 단순한 파라미터(매개변수) 규모나 벤치마크 점수 경쟁을 넘어, 실제 업무를 스스로 처리하는 ‘에이전트(Agent) 능력’과 인프라 구축 비용을
blog.naver.com · 2026.07.23
-
LG 그램 AI PC vs 갤럭시북5 Pro, 7월 지금 100만원대 AI 노트북 하나만 고른다면 어떤 걸 사야 하나
유튜브 리뷰를 몇 개 봤는데 대부분 벤치마크 점수 비교에서 끝났고, 실제로 하루 종일 들고 다니면서 쓸 때 어떤 차이가.......
blog.naver.com · 2026.07.24
-
클로드 Opus 5 출시 "요즘 똥줄이 타긴 타나 봐..."
누가 벤치마크 1위냐를 다투던 판이 이제는 "같은 성능을 얼마에 저렴한 값에 사용할 수 있느냐"로 넘어갔다. 기업들도 이제 성능 점수 1~2점 차이보다 같은 일을 처리하는 데 드는 호출 비용을 더 따지기 시작했다는 분석이 나온다.
blog.naver.com · 2026.07.26
-
'전설의 귀환인가' 16인치 노트북 추천 Dell 델 XPS 16 DA16260 리뷰
배터리 유지 시간, 온도 측정 결과, 벤치마크 점수 등 가감 없는 디테일한 실측 데이터를 바탕으로 이 제.......
blog.naver.com · 2026.07.07
-
유튜버의 마케팅에 속지 않고 '진짜 부품'을 고르는 11가지 실전 가이드 (겉보기 스펙에 가려진 컴퓨터 하드웨어의 어두운 진실)
최근 컴퓨터를 맞추거나 업그레이드할 때 많은 분이 유튜브 견적 영상이나 대형 커뮤니티의 단순 성능 지표(벤치마크 점수)만 보고 부품을 선택하거나 추천받은 곳에서 구매한뒤 추천부품의
blog.naver.com · 2026.05.19
-
구글 ai 할 때마다 내용이 다르다!
어제 검색한 내용은 빼고 오늘 내용만 AI 개요 인텔 N3450(셀러론)과 N3540(펜티엄)의 벤치마크 기반 성능 순서와 점수는 다음과 같습니다. 1. 벤치마크 점수 (PassMark 기준) *Intel Pentium N3540: 약 1,212점 *Intel Celeron N3450: 약 1,000점 초반 ~ 1,100점 내외 (모델
blog.naver.com · 2026.04.21
블로그 결과 더보기 →