로그인
토토사이트
먹튀사이트/제보
업체홍보/구인
신규사이트
지식/노하우
놀이터홍보
판매의뢰
스포츠분석
뉴스
후기내역공유
커뮤니티
포토
포인트
보증업체
카지노 먹튀
토토 먹튀
먹튀제보
구인
구직
총판
제작업체홍보
카지노
토토
홀덤
카지노 노하우
토토 노하우
홀덤 노하우
기타 지식/노하우
유용한 사이트
토토 홍보
카지노 홍보
홀덤 홍보
꽁머니홍보
신규가입머니
제작판매
제작의뢰
게임
축구
야구
농구
배구
하키
미식축구
스포츠뉴스
연예뉴스
IT뉴스
카지노 후기
토토 후기
홀덤 후기
자유게시판
유머★이슈
동영상
연예인
섹시bj
안구정화
출석하기
포인트 랭킹
포인트 마켓
로그인
자동로그인
회원가입
정보찾기
뉴스
더보기
[]
국힘, 전체 당협위원장 재선출 검토‥'대거 물갈이' 시사
N
[]
청주생활자원회수센터 현도에 존치…주민 "행정신뢰 붕괴"(종합)
N
[IT뉴스]
딥핑소스 “현장 수기 집계, AI가 대신한다”…자동차 전시장 고객 유형 분석도 자동화
N
[IT뉴스]
[스타트업人] AI 올인원 브랜딩 솔루션 개발, 타이디비 디자이너 이야기
N
[IT뉴스]
두나무의 ‘업비트데이터랩’, 자산 분류 체계 고도화… ‘영지식 인프라’도 한눈에
N
커뮤니티
더보기
[유머★이슈]
바란 은퇴보다 더 소름돋는점
[유머★이슈]
오늘 국군의날 예행연습에 최초 공개된 장비들
[유머★이슈]
손흥민이 한국 병역 시스템에 영향 끼친 것.
[유머★이슈]
시댁의 속터지는 스무고개식 대화법
[유머★이슈]
엄마. 나 여자 임신시켜버렸어
목록
글쓰기
[IT뉴스]모티프 47점·업스테이지 37점·SKT 35점·LG 31점…AAII ‘벤치마크 한계’도(종합)
온카뱅크관리자
조회:
3
2026-08-13 14:27:31
<div id="layerTranslateNotice" style="display:none;"></div> <strong class="summary_view" data-translation="true">독파모 3차 평가에 들어가는 AAII 결과 공개<br>모티프 국내 1위·글로벌 LLM 10위<br>AI 에이전트 시대 실제 활용 능력 모두 반영하기 어려워<br>NIA 비공개 평가 등 최종 결과 주목</strong> <div class="article_view" data-translation-body="true" data-tiara-layer="article_body" data-tiara-action-name="본문이미지확대_클릭"> <section dmcf-sid="1wfgLPCEEA"> <p contents-hash="aa20afba1543d585bf3ee50e316e5b6ed55fdce9bca926c8c5c0cb833be92ebb" dmcf-pid="tr4aoQhDmj" dmcf-ptype="general"> [이데일리 김현아 기자] 국내 ‘AI 국가대표’ 선발전인 독자 AI 파운데이션 모델 사업(독파모)에 참여한 4개 기업의 글로벌 AI 평가 결과가 공개됐다. 모티프테크놀로지스의 ‘Motif 3’가 47점으로 가장 높았고, 업스테이지 37점, SK텔레콤(017670) 35점, LG(003550) AI연구원 31점 순으로 나타났다.</p> <p contents-hash="1169ce0de0d9a80c2d77ebeab40cf0189296cedc94b3542b6de36697d41ae066" dmcf-pid="Fm8NgxlwON" dmcf-ptype="general">글로벌 평가기관이 동일한 기준으로 국내 AI 모델을 비교했다는 점에서 의미가 있지만, AAII 점수만으로 모델의 종합적인 경쟁력이나 실제 활용 능력을 판단하기에는 한계가 있다는 지적도 나온다. </p> <p contents-hash="012206212a6530fcd95e4915d39d216ddc03289fac0e7a99707dd883682fc31e" dmcf-pid="3DVon6IkDa" dmcf-ptype="general">특히 AI가 단순 질의응답을 넘어 복잡한 업무를 스스로 수행하는 에이전트 AI로 발전하면서 기존 벤치마크가 실제 업무 능력을 얼마나 반영할 수 있는지가 새로운 평가 과제로 떠오르고 있다.</p> <figure class="figure_frm origin_fig" contents-hash="e1d738ea5e0d4113f85d685b002d1e85bcc5245e55da64956692c079b2088591" dmcf-pid="0wfgLPCEsg" dmcf-ptype="figure"> <p class="link_figure"><img alt="모티프 47점·업스테이지 37점·SKT 35점·LG 31점…AAII ‘벤치마크 한계’도(종합)" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/13/Edaily/20260813141739903hyuh.jpg" data-org-width="1024" dmcf-mid="5ORDkiYCEc" dmcf-mtype="image" height="auto" src="https://img3.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/13/Edaily/20260813141739903hyuh.jpg" width="658"></p> <figcaption class="txt_caption default_figure"> 모티프 47점·업스테이지 37점·SKT 35점·LG 31점…AAII ‘벤치마크 한계’도(종합) </figcaption> </figure> <div contents-hash="3f4d29180460d671166b89ffd4179e942079d994c0347aea52029b965cee3250" dmcf-pid="pr4aoQhDIo" dmcf-ptype="general"> <strong>모티프 47점으로 1위…업스테이지·SKT·LG 뒤이어</strong> </div> <p contents-hash="addfd69b04f67773002d868dc37d93bfaf7272b3229a6214c97dfa8db3b7a049" dmcf-pid="Um8NgxlwDL" dmcf-ptype="general">13일 글로벌 AI 분석기관 아티피셜 애널리시스(Artificial Analysis)가 공개한 ‘Artificial Analysis Intelligence Index(AAII) v4.1.1’에 따르면 모티프의 Motif 3는 47점을 기록했다.</p> <p contents-hash="71e38b27c663a1eb18d2f90967808acd80d188c39574b7a856627e8c3c7ec784" dmcf-pid="us6jaMSrrn" dmcf-ptype="general">업스테이지의 ‘Solar Open 2 250B’가 37점으로 2위, SK텔레콤의 ‘A.X K2’가 35점으로 3위, LG AI연구원의 ‘K-EXAONE 2.0 0803’이 31점으로 뒤를 이었다.</p> <p contents-hash="44fbc184c24f953661f9197bf47c34b5b0f2a615a93cdcd57fd7653d85c2cdba" dmcf-pid="7OPANRvmEi" dmcf-ptype="general">AAII는 수학·과학·코딩·추론 등 여러 분야의 평가 결과를 종합해 AI 모델의 성능을 하나의 점수로 보여주는 지표다. 이번 평가에는 금융 업무, 코딩, 과학·수학 문제, 장문 추론, 정보 정확성 등을 평가하는 9개 항목이 활용됐다.</p> <p contents-hash="430ab0f9a0df99a991388d7500d0ab38076f46778ccf0cbb9fdfd60a4c9a974a" dmcf-pid="zIQcjeTssJ" dmcf-ptype="general">모티프3는 글로벌 대규모언어모델(LLM) 가운데 10위, 오픈웨이트 모델 가운데 4위에 올랐다. 특히 금융 업무를 수행하는 AI 에이전트와 코딩 능력을 평가하는 일부 항목에서 강점을 보였다.</p> <p contents-hash="7cba40981c179579b2a9973323b958db2c44eeaa7995ea6fbba55c22a5b66c8f" dmcf-pid="qCxkAdyOId" dmcf-ptype="general">모티프는 이날 Motif 3의 모델 가중치뿐 아니라 학습 코드와 라이브러리까지 공개하며 모델 생태계 확대에도 나섰다.</p> <p contents-hash="1454d763a1359d4bfcf9f7b55f48294a0165c67720410d859da75a507a9e804f" dmcf-pid="BFkWTr71me" dmcf-ptype="general"><strong>AAII 25점 반영…독파모 최종 순위와는 별개</strong></p> <p contents-hash="1aefa13eb51bf48050b90e253dd40e388481c793424c00a4ee7724cb9b1f1001" dmcf-pid="b3EYymztmR" dmcf-ptype="general">이번 결과가 주목받는 이유는 과학기술정보통신부의 독파모 3차 평가와 직접 연결되기 때문이다.</p> <p contents-hash="e4d123d47b340f5f65436497ba40652787a4c92e485e40315968ed273249035d" dmcf-pid="K0DGWsqFsM" dmcf-ptype="general">3차 평가에서는 LG AI연구원, 업스테이지, SK텔레콤, 모티프테크놀로지스 등 4개 기업 가운데 1곳이 탈락한다. </p> <p contents-hash="bddf0eb488ca05ae29ae56add15ad3d03938417c63cf8914dd8a3a0dd26c8164" dmcf-pid="9pwHYOB3Dx" dmcf-ptype="general">독파모 평가에서 벤치마크 영역은 총 40점으로, 이 가운데 AAII가 25점, 한국지능정보사회진흥원(NIA)의 자체 벤치마크가 15점을 차지한다. 나머지 60점은 전문가 평가 35점과 사용자 평가 25점으로 구성된다.</p> <p contents-hash="dd2072e44572ca9f92fd892e8c1cdacdaa6104076bdcdc5962f0ff45f9144086" dmcf-pid="2UrXGIb0mQ" dmcf-ptype="general">AAII가 전체 평가의 25%를 차지하는 만큼 이번 점수 차이가 최종 결과에 상당한 영향을 미칠 수 있다. 하지만 AAII가 독파모 최종 순위를 결정하는 것은 아니다.</p> <p contents-hash="49ef23dd6f1f332aa3a22fc3472e170513886e3c302b3b53c6384cdf830dc6b0" dmcf-pid="VumZHCKpEP" dmcf-ptype="general">특히 NIA의 비공개 평가와 전문가·사용자 평가가 남아 있어 AAII 순위가 독파모 최종 순위와 반드시 일치한다고 볼 수 없다.</p> <p contents-hash="1da312c7f370508a04ccdd21bccc35e496555809c6bb41338516c313bce4e697" dmcf-pid="f7s5Xh9UI6" dmcf-ptype="general"><strong>“AAII, 에이전트 AI 실제 업무 능력 평가엔 한계”</strong></p> <p contents-hash="32aaa2f815f9de229c3b48f0aada8e6601376a7dd96dfcb15281f04d15f84d50" dmcf-pid="4zO1Zl2uO8" dmcf-ptype="general">이번 결과를 놓고 전문가는 AAII의 유용성을 인정하면서도 평가 방식의 한계를 지적했다.</p> <p contents-hash="dd4be038c3fb4ca1cb43e7a0630b6983d5b54c82bc59ca51f99a697e530d2232" dmcf-pid="8qIt5SV7O4" dmcf-ptype="general">국가 AI전략위원회 기술혁신·인프라 분과 한 위원은 “아티피셜 애널리시스(Artificial Analysis) 같은 평가는 여러 모델의 성능을 빠르게 비교할 수 있다는 점에서 의미가 있다”면서도 “현재의 평가 방식만으로 에이전트 AI의 실제 업무 수행 능력을 모두 평가하기에는 한계가 있다”고 말했다.</p> <p contents-hash="5033240cc3a0f5563b9f24a7d29932ce532b2792457a6c9bd277713d706b5e43" dmcf-pid="65jvlEpXmf" dmcf-ptype="general">AI가 단순히 질문에 답하는 수준을 넘어 여러 차례 대화를 이어가고 웹사이트나 참고자료를 찾아 정보를 확인한 뒤 실제 업무를 수행하는 단계로 발전하고 있다는 이유에서다.</p> <p contents-hash="017fdda83cf63fe86c863b66d5ec9e87e2cb01f2723331b0811f9616a15cb056" dmcf-pid="P1ATSDUZmV" dmcf-ptype="general">그는 “에이전트 AI는 하나의 업무를 수행하는 과정에서도 여러 단계의 추론과 실행이 필요하다”며 “기존 벤치마크만으로는 이런 복합적인 능력을 충분히 평가하기 어렵다”고 설명했다.</p> <p contents-hash="3570a3f7118b7026aaa4039bce2fc2810f15a453fa41feea840b359a1e28b26c" dmcf-pid="Qtcyvwu5I2" dmcf-ptype="general">실제 업무 수행 능력을 평가하려면 문제 해결 과정 전체를 확인해야 하는 만큼 평가에 필요한 시간과 비용도 커진다. 이 때문에 현재는 여러 모델의 성능을 빠르게 비교할 수 있는 기존 벤치마크가 널리 활용되고 있지만, 실제 AI 서비스 환경과는 차이가 있을 수 있다는 설명이다.</p> <p contents-hash="d81c444ee2e1b63806a8f73c8245f46017725a2cd323a9884cb11d14535b94ed" dmcf-pid="xFkWTr71w9" dmcf-ptype="general">다만 “AAII가 의미 없는 지표라는 것은 아니다”라며 “여러 모델의 성능을 동일한 기준에서 비교할 수 있다는 점에서 유용하지만, 에이전트 AI 시대의 모델 성능을 보여주는 유일한 지표로 봐서는 안 된다”고 말했다.</p> <p contents-hash="e99f2c95c4b1fbd5fbb19340132c453502875172d53b445e7bcf443eb660c22b" dmcf-pid="yg7MQbkLmK" dmcf-ptype="general"><strong>업스테이지·SKT “단일 지표로 모델 완성도 판단 어려워”</strong></p> <p contents-hash="ab6465eb3c458ea58e825ef98c31348d6048611ef59d9e893932f968945eb827" dmcf-pid="WazRxKEosb" dmcf-ptype="general">AAII에서 모티프에 뒤진 업스테이지와 SK텔레콤 역시 AAII 점수만으로 모델의 완성도를 판단해서는 안 된다는 입장이다. LG AI연구원은 별도 입장을 내지 않았다.</p> <p contents-hash="1d43d6156106dbc33df8162c41e658ed2cbabf4e4efe9c35041a4e1e4927331f" dmcf-pid="YNqeM9DgmB" dmcf-ptype="general">SK텔레콤은 “AAII는 독파모 평가 기준의 일부이며 전문가 평가와 사용자 평가도 남아 있다”며 “단일 지표만으로 모델의 완성도를 대표하기 어렵다는 점을 고려해 달라”고 밝혔다.</p> <p contents-hash="53f55128a87be6db6e9da7f0e932c666baa704a06dffb2f1b07c775b7b57f6f6" dmcf-pid="GjBdR2wamq" dmcf-ptype="general">이어 “모델의 경쟁력은 지표뿐 아니라 실제 활용 환경에서의 성능·비용·안정성이 함께 평가돼야 한다”며 “지표상 보완이 필요한 영역은 개선하면서 실제 사용 환경에서의 성능 향상도 병행할 계획”이라고 밝혔다.</p> <p contents-hash="b1148952956c7f54053e14430975e6843cda3d1e979583a1ac091d146b06f3c7" dmcf-pid="HAbJeVrNOz" dmcf-ptype="general">업스테이지 역시 “AAII 벤치마킹 결과가 의미 없는 것은 아니지만 이를 모델 성능의 절대적인 기준으로 봐서는 안 된다”며 “NIA의 비공개 평가도 함께 봐야 한다”고 말했다.</p> <p contents-hash="1622ee2672125c79a22da7b30aa0e7b9e78d50f515f6d9a64fa0cbdcb33cd0f3" dmcf-pid="XTJmwoXSw7" dmcf-ptype="general"><strong>‘AAII 1위’가 독파모 최종 1위로 이어질까</strong></p> <p contents-hash="0d19e04168bbac3b3d2d12f7ec0a753bdeacbccc50c6484c0addf7576456697a" dmcf-pid="ZyisrgZvsu" dmcf-ptype="general">이번 AAII 결과는 국내 AI 모델을 동일한 글로벌 기준에서 비교했다는 점에서 의미가 있다. 특히 모티프3가 글로벌 모델들과 비교해 높은 점수(10위)를 기록하면서 국내 AI 업계에서도 주목할 만한 성과로 평가된다.</p> <p contents-hash="cfa501e1d17c8df80395237768fce9ac71e414a770f77672a8b44fde68b26bba" dmcf-pid="5WnOma5TOU" dmcf-ptype="general">하지만 AAII 점수만으로 모델의 종합적인 경쟁력을 판단하기에는 분명한 한계가 있다. AAII는 여러 평가 결과를 하나의 점수로 종합하는 지표인 만큼 어떤 평가 항목을 포함하느냐에 따라 결과가 달라질 수 있다. 한국어 능력이나 특정 산업의 업무 수행 능력, 실제 서비스에서의 비용·속도·안정성 등도 점수 하나로 충분히 보여주기 어렵다.</p> <p contents-hash="5ad6654da5eff159c38b6ea6ec17fde1d1c244fc529b181bfbef20bbc32e970f" dmcf-pid="1YLIsN1yrp" dmcf-ptype="general">실제 아티피셜 애널리시스도 종합 지능 지수 외에 모델의 응답 속도, 사용 비용, 코딩 에이전트 성능 등 다양한 지표를 별도로 제공하고 있다. 하나의 종합 점수만으로 AI 모델의 모든 경쟁력을 설명하기 어렵다는 의미다.</p> <p contents-hash="6b212724b3fa0b1253203bbbe29ce7d86d776886b7664e7606b9491356ced9eb" dmcf-pid="tGoCOjtWm0" dmcf-ptype="general">현재 확인된 글로벌 평가 순위는 모티프 1위, 업스테이지 2위, SK텔레콤 3위, LG AI연구원 4위다. 그러나 이 순위가 곧 독파모 최종 순위를 의미하는 것은 아니다.</p> <p contents-hash="f9955bc3ae2526c62024cc221d619783c2c16ea6be1210a55e011ac586b1aee1" dmcf-pid="FHghIAFYE3" dmcf-ptype="general">AAII 25점에 NIA 평가 15점, 전문가·사용자 평가까지 더해지는 만큼 최종 결과에서 순위가 달라질 가능성도 있다.</p> <p contents-hash="996efcb5dbcaf74347ab0afb1b7b98f8792cc4c0f7abe029fed3d0150ff380aa" dmcf-pid="3XalCc3GOF" dmcf-ptype="general">이번 AAII 결과는 국내 AI 모델의 상대적인 성능을 가늠할 수 있는 중요한 참고 지표라는 의미가 크다. 다만 AI가 실제 산업과 서비스 현장에서 활용되기 위해서는 벤치마크 점수뿐 아니라 업무 수행 능력과 비용, 속도, 안정성 등을 함께 살펴봐야 한다.</p> <p contents-hash="93861e48f5b337c6b804a4ca34e108dc6aafe877e1334404f6f43dddc8de5729" dmcf-pid="0ZNShk0HIt" dmcf-ptype="general">독파모 3차 평가의 최종 관전 포인트 역시 ‘AAII 1위가 누구냐’를 넘어 글로벌 벤치마크 성적과 실제 AI 활용 능력을 어떻게 종합적으로 평가할 것인지에 맞춰질 전망이다.</p> <p contents-hash="002911e72ea4201ebf6f152a43d92eabf26b0d1acc2ef541e1752036dc6db618" dmcf-pid="p5jvlEpXD1" dmcf-ptype="general">김현아 (chaos@edaily.co.kr) </p> </section> </div> <p class="" data-translation="true">Copyright © 이데일리. 무단전재 및 재배포 금지.</p>
댓글등록
댓글 총
0
개
맨위로
이번주
포인트
랭킹
매주 일요일 밤 0시에 랭킹을 초기화합니다.
1
4,000
상품권
2
3,000
상품권
3
2,000
상품권
업체홍보/구인
더보기
[구인]
유투브 BJ 구인중이자나!완전 럭키비키자나!
[구인]
에카벳에서 최대 조건으로 부본사 및 회원님들 모집합니다
[구인]
카지노 1번 총판 코드 내립니다.
[구인]
어느날 부본사 총판 파트너 모집합니다.
[구인]
고액전용 카지노 / 헬렌카지노 파트너 개인 팀 단위 모집중 최고우대
놀이터홍보
더보기
[홀덤 홍보]
텍사스홀덤 핸드 순위- 홀카드의 가치
[홀덤 홍보]
텍사스홀덤 핸드 순위 - 프리플랍(Pre-Flop) 핸드 랭킹
[토토 홍보]
미니게임개발제작 전문업체 포유소프트를 추천드립니다.
[토토 홍보]
2023년 일본 만화 판매량 순위 공개
[토토 홍보]
무료만화 사이트 보는곳 3가지 추천
지식/노하우
더보기
[카지노 노하우]
혜택 트렌드 변화 위험성 다시 가늠해 보기
[카지노 노하우]
호기심이 부른 화 종목 선택의 중요성
[카지노 노하우]
카지노 블랙잭 카드 조합으로 히트와 스탠드를 결정하는 방법
[카지노 노하우]
흥부가 놀부될때까지 7
[카지노 노하우]
5월 마틴하면서 느낀점
판매의뢰
더보기
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
포토
더보기
채팅하기