로그인
토토사이트
먹튀사이트/제보
업체홍보/구인
신규사이트
지식/노하우
놀이터홍보
판매의뢰
스포츠분석
뉴스
후기내역공유
커뮤니티
포토
포인트
보증업체
카지노 먹튀
토토 먹튀
먹튀제보
구인
구직
총판
제작업체홍보
카지노
토토
홀덤
카지노 노하우
토토 노하우
홀덤 노하우
기타 지식/노하우
유용한 사이트
토토 홍보
카지노 홍보
홀덤 홍보
꽁머니홍보
신규가입머니
제작판매
제작의뢰
게임
축구
야구
농구
배구
하키
미식축구
스포츠뉴스
연예뉴스
IT뉴스
카지노 후기
토토 후기
홀덤 후기
자유게시판
유머★이슈
동영상
연예인
섹시bj
안구정화
출석하기
포인트 랭킹
포인트 마켓
로그인
자동로그인
회원가입
정보찾기
뉴스
더보기
[]
국회 데뷔한 韓총리...“예측가능·신속 주택공급, 총리의 가장 중요한 작업”
N
[]
8월 하순 역대급 무더위…폭염경보 부산 낮 최고기온 35.9도(종합)
N
[IT뉴스]
스마일게이트 '에픽세븐', 스팀 간다…8년차 게임의 '도약'
N
[IT뉴스]
“신규IP 발굴, 게임 생태계 동반 성장”…넥슨 2500억 투자 ‘승부수’
N
[IT뉴스]
단순 탐지 넘어 '자율 방어'…이글루, AI 보안관제 '속도'
N
커뮤니티
더보기
[유머★이슈]
바란 은퇴보다 더 소름돋는점
[유머★이슈]
오늘 국군의날 예행연습에 최초 공개된 장비들
[유머★이슈]
손흥민이 한국 병역 시스템에 영향 끼친 것.
[유머★이슈]
시댁의 속터지는 스무고개식 대화법
[유머★이슈]
엄마. 나 여자 임신시켜버렸어
목록
글쓰기
[IT뉴스]독파모 최종전 '실행력' 본다…평가기준·투명성 과제로
온카뱅크관리자
조회:
0
2026-08-24 15:07:25
<div id="layerTranslateNotice" style="display:none;"></div> <strong class="summary_view" data-translation="true">NIA 벤치마크 평가서 에이전트·코딩 분야 신규 구축…최종 2개 팀 가를 평가 방식 주목</strong> <div class="article_view" data-translation-body="true" data-tiara-layer="article_body" data-tiara-action-name="본문이미지확대_클릭"> <section dmcf-sid="Pq1BYrqFkU"> <p contents-hash="fe2ed7dfa9196238d35aa30c739f24d61138a4f4c1d201d76a3ea228e26b69f1" dmcf-pid="Qi8nK1iPgp" dmcf-ptype="general">(지디넷코리아=이나연 기자)<span>정부 주도의 국가대표 인공지능(AI) 선발전인 '독자 AI 파운데이션 모델(독파모)' 프로젝트가 내년 초 최종 2개 팀을 가린다. 마지막 단계평가를 앞두고 정부가 벤치마크 자체 평가 항목 중 도구·에이전트와 코딩 분야를 구축하기로 하면서 결과에 어떤 영향을 미칠</span><span>지 주목된다.</span></p> <p contents-hash="64360e456a8769a2eddea98569165c7583840b2f3fa466b7e77d0f85f1d0b04a" dmcf-pid="xn6L9tnQk0" dmcf-ptype="general">24일 업계에 따르면 한국지능정보사회진흥원(NIA)은 지난 12일 'AI 모델 벤치마크 데이터셋 구축 사업(2차)' 공모를 냈다. 도구·에이전트와 코딩 2개 분야에서 한국어 기반 벤치마크 데이터셋을 구축하는 사업으로, 다음 달 11일까지 참가 신청을 받는다. 총사업비는 12억원이며 분야당 6억원이 지원된다.</p> <p contents-hash="f522868a73243db84693ba8fbca5e2ad2811d8d2fcb66f914a2b4b3271199839" dmcf-pid="y5S1so5Tk3" dmcf-ptype="general"><strong>벤치마크 자체 평가에 에이전트·코딩 분야 신규 편입</strong></p> <p contents-hash="338aea8c354b2c4402732e3bfe0c0f718f2dfc18b07d997aeed2249adbba7366" dmcf-pid="W1vtOg1yjF" dmcf-ptype="general">이 사업은 독파모 평가에 쓰이는 벤치마크를 만드는 과제다. 실제 공모안내서에는 이 사업이 독파모 프로젝트와 함께 과기정통부의 월드 베스트 거대언어모델(LLM) 데이터 활용 지원 사업' 산하에서 추진된다고 명시됐다. 이렇게 구축된 데이터셋은 AI 모델 성능 검증을 2회 지원하게 된다.</p> <figure class="figure_frm origin_fig" contents-hash="17f86ab93c494da9ea346e228b61bf1d99b4044caf2b308bd28b7d818ef4e036" dmcf-pid="YtTFIatWAt" dmcf-ptype="figure"> <p class="link_figure"><img alt="2026년 AI 모델 벤치마크 데이터셋 구축 사업(2차) 공모안내서 일부 갈무리 (사진=과기정통부, NIA)" class="thumb_g_article" data-org-src="https://t1.daumcdn.net/news/202608/24/ZDNetKorea/20260824145850145xzzj.png" data-org-width="638" dmcf-mid="6739XOKpku" dmcf-mtype="image" height="auto" src="https://img1.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202608/24/ZDNetKorea/20260824145850145xzzj.png" width="658"></p> <figcaption class="txt_caption default_figure"> 2026년 AI 모델 벤치마크 데이터셋 구축 사업(2차) 공모안내서 일부 갈무리 (사진=과기정통부, NIA) </figcaption> </figure> <p contents-hash="39e361734cfac908d58eb9ecc459d6f111af85555f9487d226794669ae2ada95" dmcf-pid="GFy3CNFYg1" dmcf-ptype="general"><span>NIA는 지난해 7월 1차로 공고했던 'LLM 성능 평가 데이터셋 구축 사업'에서 수학·지식·장문이해 3개 분야 벤치마크를 구축했다. 반면 이번 공모에서는 도구·에이전트와 코딩 분야를 신규로 구축한다. 텍스트 기반의 지식·추론 능력을 재던 1차와 달리, 2차 사업에서는 도구를 활용해 실제 과업을 완수하는 실행 능력을 새 평가 축으로 삼은 셈이다.</span></p> <p contents-hash="208cfcc5f4eb2e39bd6c0ecc68455a8a69a341051a4d480a18cae4a286c8c7cb" dmcf-pid="H3W0hj3Go5" dmcf-ptype="general"><span>이 같은 변화는 독파모 2차수가 사실상 텍스트 기반 평가에 머물렀다는 지적을 반영한 것으로 풀이된다. </span><span>2차 평가에 </span><span>오른 </span><span>LG AI연구원, 업스테이지, SK텔레콤, 모티프테크놀로지스 4개 팀 모델은 모두 미국 비영리 연구기관 에포크AI의 '주목할 만한 AI 모델'에 이름을 올렸지만 도메인은 언어에만 한정됐다.</span></p> <p contents-hash="250499a99ab6af9cb98a97e359e82cd372c2a9d55168bcc82e53ae6a5d7a5fed" dmcf-pid="X0YplA0HAZ" dmcf-ptype="general">모델 사용성을 보는 정성 평가도 텍스트에 한정됐다. 2차수 당시 전문가 평가와 일반 국민 평가 모두 LLM의 텍스트 응답 성능을 대상으로 이뤄졌고 파일 첨부나 이미지·영상 생성 같은 텍스트 외 기능은 평가 대상에서 빠졌다. 글로벌 프론티어 모델 경쟁이 이미지·음성·영상을 함께 처리하는 멀티모달로 이동한 것과는 대비되는 지점이다.</p> <p contents-hash="43e0d8d60d906cd7f0eabde7336b66c21a86120927130d4bdef7ddbda30746ac" dmcf-pid="ZpGUScpXoX" dmcf-ptype="general"><strong>최종 평가 어떻게 진행되나…기준 설정</strong><strong>에 쏠린 눈</strong></p> <p contents-hash="ccfb36f8a814dfbb2ed6f74c8fda6c28acedf5c87ebf903bb7607ec161e1a592" dmcf-pid="5UHuvkUZAH" dmcf-ptype="general">독파모 최종전인 3차 평가 방식은 2차 결과에 대한 이의제기 절차가 끝난 뒤 참가 팀들과의 합의를 거쳐 확정된다. 앞선 두 차례 평가 전후로 업계 안팎에서 여러 논란이 이어진 만큼 3차 평가 기준이 어떻게 짜일지에 업계 이목이 쏠린다.</p> <p contents-hash="b28179b66e6b47d34b3914314b9ead79a6596db446681ca45c593d758636e895" dmcf-pid="1uX7TEu5AG" dmcf-ptype="general"><span>독파모는 기술 독자성(프롬 스크래치) 논란에 이어 2차에서 특정 벤치마크를 겨냥한 데이터와 사후학습으로 점수를 집중적으로 끌어올리는 '벤치맥싱' 의혹에 휩싸였다. 세부 점수 공개를 둘러싼 투명성 문제도 제기됐다.</span></p> <p contents-hash="b7b2e1e798bf2f19e13af6d679e4f76fd03f54fe261986538b039cfa03ea9979" dmcf-pid="t7ZzyD71jY" dmcf-ptype="general"><span>안광섭 세종대학교 겸임교수(인레벨나인 대표)는 "사업 목표와 쓰임새를 분명히 정하고 가야 평가 논란이나 실효성에 대한 의문이 반복되지 </span><span>않는다</span><span>"며 "</span>모델을 하나의 기준으로 줄 세우기보다 크기별·용도별로 나눠 평가하는 체계도 고려해야 한다"고 말했다. </p> <p contents-hash="6b711ce86607ccd9a6e84ade6683a1ac559b7bb3e3906c1b0489da5f7bafc39d" dmcf-pid="FFy3CNFYaW" dmcf-ptype="general"><strong>벤치마크 다양화부터 투명성 개념 재정립까지</strong></p> <p contents-hash="990c709f1ffda82df974cf66807c8ad015f93c8aec4d7a2af1f4137e88fe08e6" dmcf-pid="33W0hj3Gay" dmcf-ptype="general">2차 평가에서 AAII 점수를 둘러싼 벤치맥싱 논란이 불거지면서 단일 지표에 대한 의존도를 낮춰야 한다는 목소리도 커졌다. 단순 배점만 조정해서는 벤치맥싱 같은 논란을 근본적으로 막기 어렵다는 이유에서다.</p> <p contents-hash="33d20ed10f1da8229d49b8a7e448b54ec695a9f21832828706cb18e227be5ac7" dmcf-pid="00YplA0HoT" dmcf-ptype="general"><span>업계에서는 </span><span>아티피셜 애널리시스의 AI 모델 종합평가인 'AAII' 외에도 글로벌 지표를 추가로 </span><span>검토해야 </span><span>한다는 </span><span>의견이 나온</span><span>다. </span><span>AI에 가상의 사업 운영을 맡기고 최종 잔고로 채점하는 '벤딩벤치', 실사용 세션 수백만 건으로 작업 완수를 재는 '에이전트 아레나' 등이 AAII를 보완할</span><span> 주요 지표로 거론된다.</span></p> <p contents-hash="60cab8d3210a4d6bb8da00da5a391493fe42bea05eff9ee3bf1a0895568f39f6" dmcf-pid="ppGUScpXgv" dmcf-ptype="general">안 교수는 "문제를 미리 알려주고 보는 시험은 없다"면서 "2차 평가 요소에 AAII를 추가했듯 3차에 새 지표를 넣더라도 어떤 시험지를 쓸지는 각 팀에 알려주지 않는 블라인드 방식으로 가야 한다"고 강조했다.</p> <p contents-hash="3c26c95313527ce5f3e4a901c654896a701bf3cc564a1eeb656f41ec8671295a" dmcf-pid="UUHuvkUZaS" dmcf-ptype="general">독파모 평가 지표 및 평가 결과 산출 기준에 대한 투명성의 본질이 점수 공개 여부에 있지 않다는 의견도 있다. <span>점수를 낱낱이 공개하기보다 평가가 어떤 절차와 기준으로 이뤄졌는지를 사전에 밝히는 게 우선이라는 것이다.</span></p> <p contents-hash="9ea609e74ef08017b42fe91ae9b3973eacacb443c8fe36c09f6b9944e0dc63de" dmcf-pid="uuX7TEu5Al" dmcf-ptype="general"><span>과학기술정보통신부는 2차 평가 발표 브리핑에서 </span><span>1위 기업에 대한 인식 제고와 나머지 기업에 대한 낙인 효과를 우려해 세부 순위를 밝히지 않았다. </span><span>그러나 결과 공개 이후 구체적인 점수 산출 근거에 대한 요구가 커지자 이틀 만에 보도설명자료를 내고 1차 평가와 같이</span><span> 항목별 1위 기업과 점수를 공개했다.</span></p> <p contents-hash="15ff80e6fbd9990d9fa5d4e4827f1780a7455580f2f5e409ed90427105a94de9" dmcf-pid="77ZzyD71ah" dmcf-ptype="general">안 교수는 "대학수학능력시험(수능) 출제위원도 외부와 차단된 환경에서 비공개로 문제를 만들지만 아무도 이를 불투명하다고 하지 않는다"며 "점수 하나하나를 공개하는 것보다 전문가 평가위원을 어떤 기준으로 선정했는지 등을 구체적으로 알리는 것이 투명성 확보에 더 가깝다"고 제언했다.</p> <p contents-hash="309e20a5e0144e1960e96230901775618659aabf7259d3d471c3444670f74b85" dmcf-pid="zz5qWwztAC" dmcf-ptype="general">이나연 기자(ny@zdnet.co.kr)</p> </section> </div> <p class="" data-translation="true">Copyright © 지디넷코리아. 무단전재 및 재배포 금지.</p>
댓글등록
댓글 총
0
개
맨위로
이번주
포인트
랭킹
매주 일요일 밤 0시에 랭킹을 초기화합니다.
1
4,000
상품권
2
3,000
상품권
3
2,000
상품권
업체홍보/구인
더보기
[구인]
유투브 BJ 구인중이자나!완전 럭키비키자나!
[구인]
에카벳에서 최대 조건으로 부본사 및 회원님들 모집합니다
[구인]
카지노 1번 총판 코드 내립니다.
[구인]
어느날 부본사 총판 파트너 모집합니다.
[구인]
고액전용 카지노 / 헬렌카지노 파트너 개인 팀 단위 모집중 최고우대
놀이터홍보
더보기
[홀덤 홍보]
텍사스홀덤 핸드 순위- 홀카드의 가치
[홀덤 홍보]
텍사스홀덤 핸드 순위 - 프리플랍(Pre-Flop) 핸드 랭킹
[토토 홍보]
미니게임개발제작 전문업체 포유소프트를 추천드립니다.
[토토 홍보]
2023년 일본 만화 판매량 순위 공개
[토토 홍보]
무료만화 사이트 보는곳 3가지 추천
지식/노하우
더보기
[카지노 노하우]
혜택 트렌드 변화 위험성 다시 가늠해 보기
[카지노 노하우]
호기심이 부른 화 종목 선택의 중요성
[카지노 노하우]
카지노 블랙잭 카드 조합으로 히트와 스탠드를 결정하는 방법
[카지노 노하우]
흥부가 놀부될때까지 7
[카지노 노하우]
5월 마틴하면서 느낀점
판매의뢰
더보기
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
[제작판매]
html5웹미니게임제작 해시게임제작 카드포커게임제작 스포츠토토 카지노 슬롯 에볼루션 토지노 솔루션분양임대재작
포토
더보기
채팅하기