Gemini 4 Argon 공개, 출력 100만 토큰에 보안 분야부터 출시
출처: Google 공식 블로그
원문: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
작성자: 팔복소프트-김팔복
한눈에 보기
- Google이 새 프론티어 모델 Gemini 4 Argon을 발표했지만, 현재는 Fairwind Program에 참여한 사이버 보안 방어 조직만 쓸 수 있습니다.
- 일반 공개는 유료 API 고객과 Google AI Ultra 구독자부터 시작하며, 일정은 나오지 않았습니다.
- 출시가는 100만 토큰당 입력 2달러, 출력 10달러이고, 캐시된 입력은 95% 할인됩니다.
- 한 번에 생성할 수 있는 출력 토큰 한도가 64K에서 1M으로 늘었습니다.
- Google 내부에서는 이미 C/C++ 코드를 Rust로 옮기는 대규모 마이그레이션에 쓰고 있습니다.
- 신뢰할 수 있는 방어 조직에는 사이버 관련 제한을 푼 버전을 제공합니다.
배경
최근 AI 회사들은 최상위 모델을 검증된 소수 조직에 먼저 제공한 뒤 범위를 넓히는 방식을 자주 택합니다. 취약점을 스스로 찾아낼 만큼 강력한 모델은 공격에도 쓰일 수 있기 때문입니다. 참고로 이번에 늘어난 것은 모델에 넣는 양(컨텍스트 윈도우)이 아니라 한 번에 내놓는 양(출력 한도)입니다.
주요 내용
지금 누가 쓸 수 있나
Fairwind Program 참여 조직과 Google 내부 팀뿐입니다. Google은 미국 정부의 자발적 사전 모델 접근 절차에 참여하고 있으며, 테스터 피드백으로 안전장치를 보완한 뒤 범위를 넓힐 계획입니다. 가격은 '출시 기념가'로 표기되어 있고, 유지 기간 같은 조건은 원문에 없습니다.
출력 한도 64K → 1M
Google은 모델이 한 작업 흐름 안에서 수십만 토큰을 생성할 수 있어야 어려운 문제를 한 번에 풀 수 있다고 설명합니다. 대규모 코드 변환처럼 결과물 자체가 큰 작업을 겨냥한 변화입니다.
성능 지표 (Google 발표 기준)
| 벤치마크 | 측정 대상 | 결과 |
|---|---|---|
| DeepSWE v1.1 | 장기 소프트웨어 엔지니어링 | 77.9%, 최고 성능 |
| AutomationBench (Zapier) | 업무 자동화 전 과정 | 51.3%, 1위 |
| LVBench | 긴 영상 이해 | 91.7%, 최고 성능 |
| CWE-bench v1 | 보안 취약점 수정 | 68%, 공동 1위 |
| Vals Index | 금융·코딩·법률·세무 (미국 GDP 가중) | 1위 |
Vals Finance Agent v2, Harvey의 법률 에이전트 벤치마크, Gray Swan의 간접 프롬프트 인젝션 벤치마크에서도 선두라고 밝혔습니다.
Google 내부 사례: Rust 마이그레이션
re2, libgav1 같은 수만 줄 규모 라이브러리부터 80만 줄이 넘는 Fuchsia Zircon 커널까지 C/C++를 Rust로 옮기고 있습니다. 아직 프로덕션 반영 전이며, 자동·수동 감사와 에뮬레이션 테스트를 거치는 중입니다.
비디오 디코더 libgav1에서는 기존 Rust 포트의 SIMD 코드 3만 2천 줄을, 컴파일러가 자동 벡터화할 수 있는 safe Rust로 바꿨습니다. 출력은 동일하면서 기존 Rust 포트보다 2.7배 빨라졌습니다. 이 밖에 데이터센터 메모리 300TiB 이상을 확보한 최적화 사례도 소개됐습니다.
보안 활용과 안전장치
Wiz는 공공 인프라 무료 점검 활동인 Scan for Good에 Argon을 쓰고 있고, 전 세계 병원이 쓰는 의료 소프트웨어에서 이전 모델들이 놓친 개인정보 노출 취약점을 찾아냈습니다.
안전장치로는 내부 활성화 모니터링을 통한 악용 차단, 프롬프트 인젝션 방어, 추론 과정(CoT)과 행동을 감시해 의도를 벗어나면 실행을 멈추는 장치, 샌드박스 격리를 내세웠습니다.
팔복소프트 관점
- 지금은 도입이 아니라 준비할 때입니다. 공개 일정이 없고 Fairwind 참여 조직도 공개되지 않았습니다. 우리 업무에 맞는 평가 세트를 미리 만들어 두면 출시 직후 기존 모델과 바로 비교할 수 있습니다.
- 벤치마크는 영어·미국 기준입니다. 한국어 문서나 국내 법률·세무 성능은 언급이 없습니다. 국내 업무 자동화라면 직접 테스트한 결과를 믿어야 합니다. 금융·공공처럼 데이터 반출 검토가 까다로운 조직은 출시 후에도 도입까지 시간이 걸린다는 점도 일정에 반영하세요.
- 가격은 '기념가'입니다. 장기 비용 계획의 기준으로 삼기엔 위험합니다. 출력 1M을 끝까지 쓰면 호출 한 번에 출력 비용만 10달러이고, 에이전트가 반복하면 금방 불어납니다. 반대로 같은 코드베이스를 반복 참조하는 작업은 캐시 할인 효과가 큽니다. 변하지 않는 프롬프트를 앞쪽에 고정하는 구조가 유리합니다.
- Rust 사례의 병목은 모델이 아니라 검증입니다. C/C++ 자산이 많은 임베디드, 게임 서버, 금융 코어 팀에게 반가운 방향입니다. c2rust 같은 기계적 변환 도구가 unsafe 코드투성이 결과를 내기 쉬운 것과 달리, safe Rust와 성능을 함께 잡았습니다. 하지만 Google도 별도 감사를 거치고 있습니다. 테스트 커버리지가 낮은 코드베이스는 따라 하기 어렵습니다.
- 실행 중단을 정상 시나리오로 설계하세요. 추론 감시로 실행이 멈출 수 있으니, 에이전트 파이프라인은 체크포인트에서 이어 갈 수 있어야 합니다. 프롬프트 인젝션 내성이 높아도 MCP 같은 외부 도구의 권한 최소화는 여전히 직접 챙겨야 합니다.
정리
Argon은 성능 수치보다 '어떻게 내놓는가'가 더 눈에 띄는 발표입니다. 보안 방어 조직에 먼저 주고, 실행 중 감시와 중단 장치를 전면에 내세웠습니다. 기억할 것은 출력 1M 토큰과 대규모 Rust 마이그레이션이 보여 주는 방향, 그리고 결국 도입 속도를 정하는 것은 결과를 검증할 테스트 인프라라는 점입니다.
- Gemini
- LLM
- 사이버보안
- Rust
- AI에이전트
아직 댓글이 없습니다.