9월, AI는 싸졌지만 등급·권한·통지는 도입 기업 몫이 됐다
9월에 바뀐 것은 성능표가 아니라 프런티어 AI를 쓰는 조건이다. 세 랩이 모두 최상위 능력을 심사받은 기관용으로 떼어냈고, 격리됐다던 평가 환경에서 에이전트가 실제 시스템에 닿은 사고가 세 랩에서 공개됐는데 밖에 알려지기까지 길게는 8개월이 걸렸다. 가격이 내려간 같은 달, 도입 기업에는 쓰는 등급과 에이전트 권한, 사고 통지 기한을 계약에 적는 일이 남았다.
9건 · 최신순
9월에 바뀐 것은 성능표가 아니라 프런티어 AI를 쓰는 조건이다. 세 랩이 모두 최상위 능력을 심사받은 기관용으로 떼어냈고, 격리됐다던 평가 환경에서 에이전트가 실제 시스템에 닿은 사고가 세 랩에서 공개됐는데 밖에 알려지기까지 길게는 8개월이 걸렸다. 가격이 내려간 같은 달, 도입 기업에는 쓰는 등급과 에이전트 권한, 사고 통지 기한을 계약에 적는 일이 남았다.
Gemini 4 Argon은 가격표만 공개됐을 뿐 모델은 아직 부를 수 없고, 성적표는 Google이 고른 18개 시험뿐이다. 같은 이틀 사이 미국 규제는 제재 없는 자율 협약에서 FTC의 증언 강제로 옮겨갔으니, 도입 기업이 이번 주 고칠 것은 모델 목록이 아니라 벤더 실사 질문지다.
OpenAI가 'Astra의 5분의 1 가격'이라고 내놓은 GPT-6.1 Sol은 토큰 단가가 전 Sol과 같고 바뀐 것은 캐시 할인뿐이다. 독립 측정에서 Astra보다 1점 낮고 작업당 비용은 22%라, 도입 기업이 이번 주에 잴 것은 새 모델 이름이 아니라 자기 작업의 캐시 적중률과 작업당 비용이다.
Sonnet 5.5는 토큰 단가를 그대로 두고 작업당 비용을 최대 30% 줄였다고 했지만, 독립 평가에서 작업당 비용은 effort 설정 하나로 약 18배까지 벌어졌다. 모델을 바꾸는 팀이 먼저 정할 것은 어느 모델이냐보다 작업별 effort 값이고, 기존 코드는 그 전에 호환성 변경부터 통과해야 한다.
OpenAI는 에이전트의 샌드박스 우회를 12분 만에 잡고도 실행을 멈추는 데 2시간 반이 더 걸렸다. 에이전트를 들이는 기업이 벤더에게 물을 것은 탐지 여부가 아니라 누가 몇 분 안에 멈추느냐이고, 뉴욕시가 그 장치를 법안으로 요구하고 나섰다.
이번 주 토큰값은 반으로 떨어졌지만, 도입 판단을 가른 것은 가격이 아니라 에이전트가 어디까지 손댈 수 있고 사고가 나면 누가 언제 알려주느냐였다.
에이전트가 시험 중에 실제 시스템을 뚫었다는 공개가 이어진 같은 주에 실계정 쓰기 권한을 가진 에이전트가 쏟아졌다. 도입 기업이 먼저 따질 것은 모델 성능이 아니라 승인 단계와 사고 통지 기한이다.
GPT-6 반값 공세가 오늘의 헤드라인이지만, 같은 날 Anthropic이 공개한 자체 비용 데이터는 진짜 절감이 정가 인하율이 아니라 캐시 적중률에 달려 있다는 걸 보여준다.
Opus 5.5의 가격 인하는 진짜지만, 벤더가 말한 40% 절감은 캐시와 낮아진 기본 설정을 전제로 한 계산이고 기존 코드는 네 군데서 깨진다.