블룸버그통신은 구글의 플래그십 인공지능(AI) 모델 ‘제미나이4 아르곤’ 출시를 계기로 회사 내부에서 실제 적용 시 성능에 대한 의구심이 커지고 있다는 보도를 했다. 벤치마크 점수가 우수하다는 평판과 달리, 구글의 일부 임직원들은 실제 코딩 작업에서 기대 이상의 성능을 발휘하지 못하는 문제를 지적하고 있다.
구글은 1일(현지시간) 소수 보안 파트너사들에게 제미나이4를 선공개하며, 주요 벤치마크 테스트에서 최고 점수를 기록했다는 사실을 강조했다. 특히 보안 역량 측정에서 오픈AI의 ‘아스트라’ 모델을 앞질렀다고 밝혔지만, 내부적으로는 모델의 실질적 우수성에 대한 의견이 분분하다. 일부 직원들은 앤스로픽의 ‘페이블’과 오픈AI의 아스트라가 더 빠른 속도로 발전해 나감으로써, 제미나이4가 최고 수준의 성능을 유지하더라도 특정 영역에서 경쟁사 모델에 밀릴 가능성이 있다고 지적하고 있다. 반대로 일부 내부 의견은 제미나이4가 타사 AI 모델을 충분히 따라잡고 있다는 평가도 나오고 있다.
구글에게 제미나이4의 성공은 매우 중요한 문제다. 구글의 핵심 수익원인 검색 서비스부터 지메일, 크롬 등 거의 모든 제품군에서 해당 모델을 활용하고 있기 때문이다. 이에 반해 오픈AI와 앤스로픽은 단순 모델 판매를 넘어 코딩 에이전트와 같은 자체 제품 생태계 구축을 빠르게 진행하고 있다. 만약 구글이 차세대 최첨단 모델을 시간 내에 선보이지 못한다면, 검색부터 다양한 플랫폼에서의 우위를 잃을 수 있음을 우려하고 있다.
IT 전문가들은 구글이 벤치마크 점수에만 집중하는 ‘벤치맥싱’ 현상에 빠졌다고 지적하며, 이는 실제 유용한 제품 개발과 관련된 중요성을 강조한다. AI 스타트업 서지 AI의 창업자 에드윈 첸은 ‘SAT 점수가 잘 나왔다’고 자랑하는 것이 실무 능력과 일치하지 않는 비유로, 이러한 벤치맥싱 현상을 꼬집었다.
구글 내부의 AI 연구 인력의 이탈도 우려되고 있다. 제프 딘, 존 덤퍼, 노암 샤지어 같은 핵심 인재들이 회사를 떠났다는 사실은 내부 진통의 심각성을 보여준다. 이러한 상황에서 구글은 시장 경쟁력을 유지하기 위해 새로운 전략을 모색하고 있지만, 경쟁사들은 고성능 모델 개발 속도 조절론이 제기되는 가운데도 거침없이 나아가고 있다. 메타의 AI 에이전트 ‘뮤즈’ 출시는 그러한 경쟁자들의 성공 사례 중 하나로, 시장에서 큰 호응을 얻고 있는 것으로 보인다.
결국 구글은 벤치마크 점수와 실제 적용 성능 간의 격차를 줄이기 위한 방법을 찾아야 할 필요성에 직면하고 있다. 이는 단순히 기술적 문제가 아닌, 회사 전반에 걸친 인력과 자원 관리, 그리고 글로벌 시장에서의 경쟁력 강화를 위한 포괄적인 전략을 요구한다. 구글이 내부적 엇갈림을 조정하고 외부 경쟁에 대응하는 방안을 마련할 수 있는지, 시간이 보여줄 것이다.







