TechFeedTechFeed
AI/LLM

모티프 업스테이지, 독파모, 솔라, 벤치 점수 | 2차 평가 숫자는 어떻게 읽나?

독파모 2차 평가를 앞두고 아티피셜 애널리시스 지수에서 모티프 3이 47점, 업스테이지 솔라 오픈2가 37점, SK텔레콤 에이닷엑스 K2가 35점, LG AI연구원 K-엑사원 2.0이 31점을 받았다. 벤치 40, 전문가 35, 사용자 25 배점과 LLM, API, 오픈소스, 개발자, 데이터 도입 전에 점수를 칸으로 읽는 가이드.

by

아티피셜 애널리시스가 공개한 지능 지수에서 모티프 3이 47점, 업스테이지 솔라 오픈2가 37점, SK텔레콤 에이닷엑스 K2가 35점, LG AI연구원 K-엑사원 2.0이 31점을 받았습니다. 독파모 2차 평가를 앞둔 성적표이고, 1차 때 벤치 1위였던 LG 쪽이 이번 표에서는 맨 아래입니다.


이 숫자는 최종 선발이 아닙니다. 과기정통부 2차 배점은 벤치 40, 전문가 35, 사용자 25입니다. 벤치 안에서 이 지수가 25점, 지능정보사회진흥원 점수가 15점으로 들어갑니다. 팀에 먼저 필요한 일은 점수를 칸으로 나누고, 사내 로그로 다시 재는 것입니다.


공개된 점수표 | 모티프 47, 업스테이지 37

뉴스토마토 2026년 8월 13일 보도는 아티피셜 애널리시스 인텔리전스 지수(AAII) 한 줄을 전합니다. 독파모 정예 네 팀 가운데 모티프테크놀로지스 모티프 3이 47점, 업스테이지 솔라 오픈2가 37점, SK텔레콤 에이닷엑스 K2가 35점, LG AI연구원 K-엑사원 2.0이 31점입니다.


모델운영 주체보도된 점수
모티프 3모티프테크놀로지스47
솔라 오픈2업스테이지37
에이닷엑스 K2SK텔레콤35
K-엑사원 2.0LG AI연구원31

원문은 뉴스토마토 2026년 8월 13일입니다. 지수 정의는 아티피셜 애널리시스 쪽에 있습니다. 기사에 없는 세부 과제 점수, 토큰 단가, 한국어 전용 점수는 표에 보태지 않습니다.


네 팀 안의 순위입니다 | 47점이 세계 1위라는 뜻이 아닙니다. 같은 보도는 글로벌 최상위 프런티어와 격차가 남아 있다고 적습니다. 사내 모델 교체 근거로 이 표만 붙이지 마세요.


독파모 네 팀 모델 점수를 나란히 그린 비교 보드
모티프 47, 업스테이지 37, SK텔레콤 35, LG 31. 독파모 정예팀 내부 순위

독파모 2차 배점 | 벤치 40이 전부가 아니다

과학기술정보통신부는 2차 평가를 벤치 40점, 전문가 평가 35점, 사용자 평가 25점으로 나눈다고 보도됐습니다. 벤치 40 가운데 아티피셜 애널리시스 지수가 25점, 한국지능정보사회진흥원 벤치가 15점입니다. 지금 회자되는 47·37·35·31은 그 25점 칸의 재료입니다.


사용자 평가는 8월 12일 마감한 국민평가단 사용 평가를 반영한다고 전했습니다. 전문가 칸은 산업 현장 도입, 실행력, 확장성, 운영 효율을 본다고 합니다. 벤치만 보고 최종 3팀, 내년 2월 최종 2팀을 예단하면 빗나갑니다.


모티프는 지난 2월 추가 공모로 정예팀에 늦게 합류했습니다. 임정환 대표는 짧은 기간과 제한된 자원, 독자 구조만으로 경쟁할 수 있는 수준을 보여 줬다고 밝혔습니다. 출발이 달랐다는 말은 점수 해석에 필요합니다. 같은 학습 예산, 같은 공개 일정이 아니었다는 뜻입니다.


SK텔레콤 모델 소개와 도입 체크는 에이닷엑스 K2 가이드에 있습니다. 이번 글은 그 모델의 사용법이 아니라, 2차 평가 전에 나온 외부 지수 읽기입니다. 두 글을 한 슬라이드에 합치면 목적이 섞입니다.


1차 1위가 밀린 뒤 팀이 볼 숫자

1차 평가에서 벤치 1위였던 LG AI연구원이 이번 지수에서는 네 팀 중 맨 아래입니다. 이유가 모델이 나빠서가 아니라, 측정 세트와 시점이 바뀌었을 수 있습니다. 기사에 원인 분석은 없습니다. 팀이 가져갈 문장은 “한 번의 1위로 공급사를 고정하지 않는다”입니다.


상황점수표로 하면 안 되는 일먼저 채울 칸
사내 챗봇 교체47점 모델을 즉시 기본값으로실제 로그 200~500턴 재평가
공공·국책 입찰1차 순위만 제안서에 고정2차 공식 발표문, 라이선스, 반출
코드·도구 호출지능 지수 = 코딩 점수저장소 이슈, JSON 스키마, 회귀
다국어 고객 응대한국어 우승으로 태국어·영어 교체언어별 평가셋, 폴백 API

모티프와 업스테이지 사이 10점, 1위와 4위 사이 16점입니다. 체감 품질이 그 간격만큼 벌어진다는 증거는 기사에 없습니다. 사내 평가셋에서 차이가 1~2점이면, 가격·지연·개인정보 위치가 결정을 바꿉니다.


벤치 점수와 사내 평가셋을 따로 적어 둔 화이트보드
외부 지수와 실제 상담·코드 로그는 다른 칸이다

글로벌 최상위와 격차가 남았을 때

같은 보도는 스타트업이 국내 정예팀 안에서는 앞섰지만, 글로벌 빅테크 최상위와는 거리가 있다고 적습니다. 에포크AI 지표에서는 네 팀 모델이 모두 주목할 만한 모델로 올랐다고 합니다. “주목”은 우승이 아닙니다. 존재와 추적이 시작됐다는 표시에 가깝습니다.


기본 라우팅은 그대로 두는 편이 안전합니다. 코딩, 긴 추론, 도구 호출이 많은 작업은 기존 프런티어 API를 유지합니다. 독파모 후보를 여는 조건은 데이터 반출 금지, 발주처의 국내 모델 요구, 한국어 고유명사 오류가 반복될 때입니다. 오픈 가중치 대비는 네모트론4 공개 전 체크처럼 라이선스와 서빙 비용을 같은 표에 둡니다.


동남아 로케일이나 태국어 특화는 이번 순위와 다른 문제입니다. 네이버 태국어 모델은 언어와 계약이 다릅니다. 독파모 1위 점수를 해외 로케일 근거로 쓰지 마세요.


폴백을 반드시 남깁니다. 국내 모델이 JSON 스키마나 영어 코드에서 무너지는 경우가 많습니다. 언어 감지 후 한국어 문서만 국내 모델로 보내고, 도구 호출은 범용으로 두는 구성이 흔합니다. 한 공급사로 몰아 넣으면 2차 발표 한 번에 전체가 흔들립니다.


솔라·모티프·에이닷엑스를 붙이기 전 체크

점수가 높다고 저장소를 바로 받지 않습니다. 공식 배포 채널, 라이선스, 모델 카드, 허용 국가, 금지 용도를 같은 커밋에 남깁니다. 이름만 비슷한 가중치는 공급망 사고입니다. 모티프 쪽 안내는 모티프 뉴스룸에서 확인하고, 업스테이지는 회사 공식 배포만 믿습니다.


평가셋은 번역기가 만든 문장이 아니라, 실제 상담·문서·코드에서 개인정보를 지운 샘플이어야 합니다. 경어, 사내 약어, 숫자와 주소가 들어간 문장, 영어가 섞인 문장을 비율로 넣습니다. 외부 지수와 사내 점수가 어긋나면 사내 점수를 따릅니다.


운영 칸을 채웁니다. 엔드포인트가 클라우드 API인지, 온프레미스 가중치인지, 로그가 어디에 남는지, 장애 시 누가 올리는지입니다. 국책 선정 여부와 상용 SLA는 다른 문서입니다. 2차에서 3팀, 내년 2월 2팀으로 줄어든다는 일정은 보도 기준입니다. 그 전에 프로덕션 기본값을 바꾸지 않습니다.


비용도 칸입니다. 기사에 토큰 단가가 없습니다. 견적서와 부가세, 약정 트래픽을 받기 전에는 “1위라서 싸다”고 쓰지 않습니다. 한글 장문이 같은 풀을 얼마나 닳리는지는 각 콘솔 사용량 화면으로만 확인합니다.


라이선스, 평가셋, 폴백 API를 칸으로 나눈 도입 체크리스트
공식 저장소, 사내 로그 평가, 범용 폴백을 한 커밋에 둔다

참고 자료


2차 공식 총점은 과기정통부 발표 전에 기사 숫자로 확정하지 않습니다. 기사에 없는 파라미터 수와 단가는 적지 않습니다.


자주 묻는 질문

모티프가 독파모 최종 1위인가요?

아닙니다. 지금은 외부 지능 지수에서 정예 네 팀 중 가장 높다는 보도입니다. 2차 총점은 벤치, 전문가, 사용자 평가를 합친 뒤 발표됩니다.


업스테이지 솔라를 지금 기본 모델로 바꿔도 되나요?

지수 2위만으로 바꾸지 않습니다. 라이선스, 사내 로그 평가, 지연, 데이터 위치를 채운 뒤에 일부 트래픽으로 먼저 엽니다.


LG가 1차 1위에서 왜 맨 아래로 갔나요?

보도에 원인 분석은 없습니다. 측정 세트와 시점이 바뀌면 순위가 흔들립니다. 한 번의 순위로 공급사를 고정하지 않는 편이 안전합니다.


47점이면 챗지피티나 클로드를 대체할 수 있나요?

같은 기사는 글로벌 최상위와 격차가 남아 있다고 전합니다. 코딩과 도구 호출은 기존 프런티어를 유지하고, 국내 모델은 조건이 맞을 때만 붙입니다.


2차 결과는 언제 나오나요?

국민평가단 사용 평가가 8월 12일 마감됐고, 과기정통부가 조만간 2차 결과를 발표한다고 보도됐습니다. 날짜는 기사에 특정되지 않았습니다.


최종 몇 팀이 남나요?

보도 기준으로 이번 평가에서 3팀을 추리고, 내년 2월께 최종 2팀을 선정합니다. 그 전 프로덕션 기본값 변경은 이릅니다.


모티프업스테이지독파모솔라LLMAPI오픈소스개발자데이터AI 에이전트

관련 도구

함께 보면 좋은 문제 해결

EXPLORE / AI/LLM

이어서 읽어보기

전체 토픽 둘러보기