모티프, 가장 배점 높은 AAII 평가에서 최고점수 받아사용성·활용성에서 낮은 점수 … 전문가·사용자서 박한 평가정부, 평가 과정에서 ‘벤치맥싱’ 반영되지 않아
  • ▲ 류제명 과기정통부 2차관이 18일 정부서울청사에서 독파모 2단계 평가 브리핑을 진행하고 있다.ⓒ강필성 기자
    ▲ 류제명 과기정통부 2차관이 18일 정부서울청사에서 독파모 2단계 평가 브리핑을 진행하고 있다.ⓒ강필성 기자
    모티프테크놀로지스(이하 모티프)가 독자 AI 파운데이션 모델(이하 독파모) 프로젝트 2차 단계 평가에서 가장 뛰어난 벤치마크 점수에도 불구하고 탈락해 그 이유에 이목이 쏠리고 있다.  .

    과학기술정보통신부는 18일 정부서울청사에서 진행된 독파모 2차 단계 결과 발표에서 모티프가 최종 탈락했다고 밝혔다. 이로써 3차전에 진출하는 정예팀은 업스테이지, SK텔레콤, LG AI연구원으로 확정됐다.

    이번 결과는 모티프가 글로벌 AI 성능평가 지표인 AAII(Artificial Analysis Intelligence Index) 벤치마크에서 가장 높은 점수를 받은 것을 고려했을 때 이례적이다. 독파모 2차 평가에서 가장 높은 배점인 40점이 벤치마크에 배정됐는데, 이중 AAII 평가가 25점으로 NIA 벤치마크 평가의 15점보다 더 높게 설정됐다. 

    모티프의 AI모델 ‘모티프3’는 AAII 벤치마크에서 47점을 기록해 전세계 AI모델 중 10위를 기록했을 정도로 독파모 2차 AI 중에서는 최고점을 받았다. 그럼에도 모티프가 최종 탈락자로 선정된 것은 전문가 평가(35점)과 사용자 평가(25점)에서 낮은 점수를 받았기 때문이다.

    류제명 과기정통부 2차관은 “모티프의 AAII 점수는 굉장히 높은 수준으로 눈에 띄는 성과를 보여준 건 분명한 사실”이라며 “다만 이것은 100점 만점에서 25점에 불과하고 다른 평가를 종합하면 기술력을 뛰어났지만 사용성이나 활용성에서 다른 기업들에 비해 낮은 평가를 받았다”고 전했다.

    이마저도 근소한 차이였다는 것이 정부의 입장이다. 벤치마크 평가에서 1위와 4위의 격차는 4.0점에 불과했고 전문가 평가와 사용자 평가에서 1위와 4위의 격차는 각각 2.4점과 5.0점에 달했다. 벤치마크의 우위가 전문가와 사용자 평가 과정에서 밀렸다는 이야기다. 

    다만 정부는 이번 2차 단계 평가에서 각 평가 과정에서 1위 사업자를 공개하지 않기로 했다. 여기에는 총 3가지 방법으로 진행된 평가 중 압도적으로 1위를 차지한 AI모델이 없다는 점도 주효했다. 

    류 차관은 “기업들의 순위나 또 점수 구체적인 것들을 가급적이면 공개하고 싶지만 지금 점수차이로 인해 다른 해석이나 뜻하지 않게 해당 기업이 불이익을 받을 수 있는 점을 우려했다”며 “모티프는 기술력 측면에서 세계적인 수준이라는 것을 증명했고 평가에서도 다 반영이 됐다”고 덧붙였다.

    다만 일부 논란도 예고되고 있다. 일부 AI모델이 벤치마크에서 점수를 인위적으로 높이기 위해 튜닝하는 이른바 ‘벤치맥싱(Benchmaxxing)’ 의혹이 있기 때문. 정부는 이번 평가 과정에서 ‘벤치맥싱’에 대해서는 평가를 반영하지 않았다.

    류 차관은 “‘벤치맥싱’ 부분이 일부 논란이 돼, AAII의 아티피셜 아넬리스사한테 공식적으로 분석을 의뢰했다”며 “이와 관련 시험을 잘 보는 그런 목적으로 최적화된 됐다는 문제를 입증할 만한 단서를 찾지 못했다고 공식 답변해왔다”고 말했다.

    결국 모티프는 이번 탈락으로 인해 독파모 3차전에서는 참여할 수 없게 됐다. 모티프는 독파모 1차 평가 과정에서 네이버가 독자성을 이유로 추가 탈락하자 추가 참여 신청을 통해 2차전 중간에 합류했던 스타트업이다. 정부의 GPU 지원에도 불구하고 결과적으로 경쟁사에 비해 AI 개발을 위한 시간을 확보하지 못했다는 평가가 뒤따른다.