본문 바로가기
투자/시사

구글 제미나이 4 아르곤 공개 — 뭐가 다르고, 왜 아직 못 쓰나

by AhnPlay 2026. 10. 1.

구글이 9월 30일(현지시간) 최상위 AI 모델 '제미나이 4 아르곤(Gemini 4 Argon)'을 공개했다. 올해 2월 '제미나이 3.1 프로' 이후 약 7개월 만에 내놓은 최상위 모델이고, 오픈AI가 AI 에이전트 '닷츠'를 발표한 바로 다음 날이다. 그런데 정작 일반 이용자는 아직 쓸 수 없다. 무엇이 달라졌고, 왜 문을 좁혀 놨는지 정리했다.

👉 관련 글: [2026.09.30 - [투자/시사] - 오픈AI 닷츠(Dots) 공개 — 뭐가 다르고, 챗GPT 요금제는 어떻게 바뀌나]

제미나이 4 아르곤은 어떤 모델인가

구글은 아르곤을 길고 복잡한 업무 흐름 전체를 이해하고 추론하도록 설계한 모델이라고 소개했다. 강점으로 내세운 분야는 세 가지다.

  • 실제 현장의 소프트웨어 개발(코딩)
  • 금융·법률·세무 같은 전문 지식 업무
  • 사이버 보안 방어

가장 눈에 띄는 변화는 한 번에 만들어낼 수 있는 분량(출력 토큰 한도)이다. 기존 6만 4천 토큰에서 업계 최고 수준인 100만 토큰으로 늘렸다. 구글은 이 덕분에 한 번의 요청으로 수백 쪽 분량의 복잡한 코딩이나 분석 작업을 끝낼 수 있다고 설명했다.

구글 안에서는 이미 쓰고 있다

구글은 아르곤을 내부 업무에 이미 쓰고 있다며 사례를 공개했다.

  • 데이터센터 메모리 절약: 아르곤 에이전트가 서버 데이터를 분석해 최적화 방안을 스스로 찾아 적용했고, 300TiB 이상의 메모리를 확보했다.
  • 코드 언어 전환: 80만 줄이 넘는 운영체제 커널 등 구글의 C/C++ 코드를 더 안전한 언어인 러스트(Rust)로 바꾸는 작업을 하고 있다. 결과물은 실제 배포 전에 자동·수동 검토를 거친다고 한다.
  • 동영상 디코더 개선: 동영상 디코딩 소프트웨어 'libgav1'을 고쳐, 같은 화질을 유지하면서 기존 러스트 버전보다 2.7배 빠르게 만들었다.

성능은 1위? 누가 쟀느냐에 따라 다르다

구글이 공개한 수치로는 여러 항목에서 경쟁 모델을 앞섰다. 실제 소프트웨어 개발 능력을 재는 '딥SWE v1.1'에서 77.9%로 최고 기록을 냈고, AI타임스에 따르면 이는 앤트로픽의 클로드 오퍼스 5.5(74.2%)와 오픈AI의 GPT-6 아스트라(74.1%)보다 높은 수치다. 보안 취약점 평가 'CWE-벤치 v1'에서는 GPT-6 아스트라와 공동 1위였다.

다만 이 비교는 구글이 직접 내놓은 자료다. 독립 평가기관 아티피셜 애널리시스의 종합 지능 지수에서는 53점으로, 클로드 페이블 5.1, GPT-6 아스트라와 함께 공동 3위였다. 이 기관은 수학·과학 같은 영역까지 종합해 평가하는데, 그 영역에서는 경쟁 모델에 밀렸다고 한다. 대신 이 기관은 할인 가격 기준으로 작업당 비용이 GPT-6 아스트라의 60% 수준이면서 지능 지수는 같다며 가성비를 높게 평가했다.

그런데 왜 일반인은 못 쓰나

구글은 성능이 높아진 만큼 오남용 위험도 커졌다며 일반 이용자의 접근을 당분간 막았다. 지금은 구글의 보안 프로그램 '페어윈드(Fairwind)'를 통해 검증된 사이버 보안 전문가들에게 먼저 제공하고, 미국 정부의 출시 전 모델 평가 절차에도 자발적으로 참여하고 있다.

구글 딥마인드를 이끄는 코라이 카부크추오글루 수석부사장은 "이 수준의 최첨단 기능을 안전하게 공개하려면 단계적인 접근 방식이 필요하다"고 설명했다. 구글은 초기 테스터 피드백으로 안전장치를 보완한 뒤 구글 AI 울트라 구독자와 개발자·기업 대상 API로 단계적으로 넓힐 계획이다. 구체적인 일정은 나오지 않았다.

내부에서도 엇갈리는 평가

블룸버그는 구글 내부 일부 직원들이 아르곤의 실제 코딩 성능이 벤치마크 점수만큼 나오지 않는다고 평가했다고 보도했다(동아일보 인용). 작업에 따라 편차가 있고, 특히 앱·웹 화면을 만드는 프런트엔드 디자인에서 강점을 보이지 못했다는 것이다. 반면 영상 같은 텍스트 이외 정보 처리, 안전성, 자연스러운 의사소통은 좋은 평가를 받았다고 한다. 구글은 코딩 성능이 기대에 못 미친다는 평가는 부정확하다고 반박했다.

AI 업계에서는 실제 사용성보다 시험 점수를 올리는 데 개발이 쏠리는 현상을 '벤치맥싱(benchmaxxing)'이라고 부른다. 같은 보도에 따르면 구글은 올해 5월 '제미나이 3.5 프로'를 발표하고 출시를 예고했지만, 실제로는 출시하지 않고 개발 계획을 접었다.

가격: 오픈AI 새 모델과 같은 값

아르곤의 개발자용 가격은 출시 기념 특가로 100만 토큰당 입력 2달러, 출력 10달러다. 이전에 넣은 내용을 다시 쓰는 '캐시 입력'은 95% 할인된다. 하루 전 오픈AI가 공개한 'GPT-6.1 솔'도 100만 토큰당 입력 2달러, 출력 10달러였다. 두 회사가 하루 차이로 같은 가격대의 모델을 내놓은 셈이다.

정리

아르곤은 구글이 최상위 모델 경쟁에 다시 뛰어들었다는 신호다. 다만 지금은 보안 전문가 일부만 쓸 수 있고, 성능 1위라는 주장도 누가 어떤 기준으로 쟀느냐에 따라 달라진다. 오픈AI가 '알아서 일하는 에이전트'로 승부를 걸었다면 구글은 '길고 어려운 일을 한 번에 끝내는 모델'로 맞선 모양새다. 일반 공개 일정이 나오면 다시 정리하겠다.

이 글은 구글 공식 블로그와 연합뉴스, AI타임스, 동아일보(블룸버그 인용), 보안뉴스의 2026년 9월 30일~10월 1일 보도를 바탕으로 작성했습니다. 벤치마크 수치는 별도 표기가 없으면 구글이 공개한 자료 기준입니다.

반응형

댓글