GPT-6.1 Sol 출시, Astra급 코딩 성능을 5분의 1 가격에

김팔복 2026-09-30 21:26:29
조회 65 추천 0 댓글 0

출처: OpenAI
원문: https://openai.com/ko-KR/index/introducing-gpt-6-1-sol/
작성자: 팔복소프트-김팔복

한눈에 보기

  • OpenAI가 중간 등급 모델 GPT-6 Sol의 업그레이드판인 GPT-6.1 Sol을 공개했습니다.
  • API 표준 단가는 입력 100만 토큰당 $2, 출력 $10으로 최상위 모델 GPT-6 Astra의 5분의 1입니다.
  • 코딩 벤치마크 DeepSWE v1.1에서 Astra와 대등한 점수를 약 5분의 1 비용으로 냈다는 것이 OpenAI의 설명입니다.
  • 캐시된 입력은 100만 토큰당 $0.10이라, 같은 컨텍스트를 반복해 보내는 에이전트 작업일수록 절감 폭이 커집니다.
  • 종합 성능 1위는 여전히 Astra이고, OpenAI도 가장 어려운 과학 연구 작업에는 Astra를 권합니다.
  • API(gpt-6.1-sol)와 ChatGPT Work·Codex에서 바로 쓸 수 있지만 일반 Chat에는 아직 없습니다.

배경

GPT-6 세대는 Astra(최상위), Sol(중간), Luna(경량) 세 등급으로 나뉩니다. Astra가 9월 3일, Sol과 Luna가 9월 22일에 나왔으니 이번 6.1 Sol은 한 달이 채 안 돼 나온 중간 등급 업데이트입니다. 실서비스에서 가장 많이 호출되는 건 대개 중간 등급 모델이라, 이쪽 변화가 월말 청구서에 더 직접적으로 반영됩니다.

가격표부터 보면

gpt61-sol-api-pricing.png

모델 입력 캐시된 입력 출력 위치
GPT-6 Astra $10 $1 $50 최고 성능
GPT-6.1 Sol $2 $0.10 $10 성능 대비 비용
GPT-6 Luna $0.10 $0.01 $0.50 대량·일상 처리

(100만 토큰당 USD, OpenAI 공개 기준)

캐시 입력 할인율도 눈여겨볼 부분입니다. Astra는 캐시 입력이 표준 입력의 10분의 1인데, Sol은 5% 수준입니다. 편집자가 가정한 예로, 입력 10만 토큰 중 9만 토큰이 캐시되고 출력이 5천 토큰인 요청을 계산하면 Sol은 약 $0.079, Astra는 약 $0.44입니다. 캐시 비중이 높을수록 두 모델의 격차는 5배보다 더 벌어집니다.

벤치마크로 본 GPT-6.1 Sol

아래 수치는 모두 OpenAI가 발표한 것이며, 경쟁 모델 수치는 OpenAI가 공개 보고서에서 가져왔다고 밝혔습니다.

벤치마크 무엇을 재나 OpenAI 발표 결과
DeepSWE v1.1 실제 코드베이스의 장기 엔지니어링 과제 Astra와 대등, 비용 약 1/5
GDP.pdf 표·차트가 많은 전문 PDF 질의응답 Opus 5.5보다 높고 비용 절반 미만
AutomationBench 1.0.6 47개 도구를 쓰는 업무 자동화 Opus 5.5 대비 +2.2%p, 비용 약 1/3
OSWorld 2.0 오프라인 세트 장시간 컴퓨터 조작 Astra와 2.1%p 차, 비용 약 1/7
Terminal-Bench Science 0.1 데이터 분석·시뮬레이션 GPT-6 Sol 점수의 2배 이상

gpt61-sol-science-cost.png

사실 오류율은 4.1%로 GPT-6 Sol(4.5%)보다 낮아졌고 Astra(4.0%)에 근접했습니다. 다만 사용자가 오류를 신고했던 대화만 골라 만든 평가라 일상적인 오류율로 읽으면 안 됩니다.

에이전트로 쓸 때 볼 숫자

검색 도구가 고장 났을 때 추측으로 답하지 않고 사용자에게 알리는지 본 평가에서, 알리지 않은 비율은 GPT-6.1 Sol 2.8%, GPT-6 Sol 4.9%, Astra 1.5%, Luna 28.7%였습니다. Luna를 도구 호출이 많은 에이전트에 쓴다면 도구 결과 검증 로직을 따로 두는 편이 안전합니다.

같이 나온 Ultrafast 버전은 최대 8배 빠르지만, Sol Ultrafast의 API 비용은 기존 Astra와 거의 같습니다. 싸진 선택지가 아니라 빨라진 선택지입니다.

팔복소프트 관점

gpt6-model-selection-guide.png

  • GPT-6 Sol을 이미 쓰는 팀이라면 바로 비교 실험을 돌릴 만합니다. 모델명만 바꾸면 되는 구조라 검증 비용이 낮고, 달러로 과금되는 국내 팀 입장에서는 Astra 대신 Sol로 버틸 수 있는 구간이 넓어진 것만으로도 의미가 큽니다.
  • 토큰 단가와 작업당 비용은 다릅니다. 발표 수치 상당수가 최대 추론 강도 기준이고, 추론 강도를 올리면 출력 토큰이 늘어 비용도 같이 오릅니다. 자사 워크로드로 추론 강도별 품질·비용을 직접 재봐야 합니다.
  • 한국어 성능 수치는 원문에 없습니다. 스캔된 공문이나 HWP에서 변환한 PDF처럼 국내 문서 특유의 형식은 GDP.pdf 결과만 믿고 넘어가기 어렵습니다. 사내 문서 20~30건으로 된 소규모 평가 세트라도 먼저 만드는 것을 권합니다.
  • 캐싱 설계가 절감액을 좌우합니다. 시스템 프롬프트, 도구 정의, 고정 컨텍스트를 요청 앞쪽에 모아 두어야 캐시 할인을 제대로 받습니다.
  • 경쟁 모델 비교는 한 번 걸러 읽으세요. 비교 조건(폴백 처리, 추론 설정)을 발표사가 정했습니다. OpenAI도 한 벤치마크에서 Claude Fable 5.1의 비용이 폴백 비용을 빼고 계산돼 실제보다 낮게 표시됐다고 각주로 밝혔습니다.
  • 금융·공공 쪽은 가격보다 데이터 경로가 먼저입니다. 원문에는 리전이나 클라우드 제공 경로에 대한 언급이 없으니, 망분리·국외 이전 요건이 있는 조직은 도입 전에 별도로 확인해야 합니다.

정리

이번 발표의 핵심은 새 최고 성능이 아니라 가격 구간의 재배치입니다. 지금까지 Astra를 써야 했던 코딩·문서·자동화 작업 중 상당 부분을 5분의 1 단가로 옮길 수 있는지, 각 팀이 자기 데이터로 확인해볼 시점입니다. 가장 어려운 문제는 여전히 Astra 몫이고, 빠른 응답이 필요하면 Ultrafast의 비용이 Astra 수준이라는 점을 기억해 두면 됩니다.


  • OpenAI
  • GPT-6.1 Sol
  • LLM API 비용
  • AI 코딩 에이전트
  • 프롬프트 캐싱

댓글 0

아직 댓글이 없습니다.