Codex 에이전트 실행 엔진이 API로 열렸다, 데이터는 미국에만 두고 ZDR 불가
OpenAI가 9월 10일 Codex 하네스를 Agents API 공개 베타로 열었습니다. API 요금은 없고 호스팅 샌드박스는 4GB 기준 20분에 0.12달러입니다. 베타 동안 데이터는 미국에만 저장되고 ZDR은 적용되지 않습니다.
- OpenAI가 Codex를 돌리는 에이전트 루프를 Agents API 공개 베타로 열었습니다.
- API 요금은 없고, 4GB 샌드박스를 쓰면 시간당 0.36달러가 붙습니다.
- 베타 동안 데이터는 미국에만 저장되고 ZDR은 적용되지 않습니다.
OpenAI가 9월 10일 공개한 Agents API는 몇 시간씩 걸리는 AI 작업을 대신 끝까지 돌려 주는 API입니다. 요청 한 번에 답 하나를 받는 방식이 아니라 작업을 맡기면 모델이 코드를 실행하고 파일을 만들고 필요하면 하위 에이전트에게 일을 나눠 준 뒤 결과를 돌려줍니다. 공개 베타여서 API 키가 있는 개발자라면 누구나 오늘 쓸 수 있습니다. Hacker News 게시물은 345점을 받았고 댓글 180개가 달렸습니다.
OpenAI는 이 기능이 Codex와 ChatGPT for Work에서 쓰는 하네스(harness)를 그대로 떼어낸 것이라고 밝혔습니다. 하네스는 모델 호출, 도구 실행, 대화 기록 관리, 실패 후 재시도를 묶어 반복하는 실행 루프를 말합니다. 이 루프는 OpenAI 서버에서 돕니다. 명령과 파일 작업이 실제로 실행되는 곳(샌드박스)은 개발자가 고릅니다.

지금까지 직접 만들던 부분
Agents API가 대신하는 것은 에이전트를 운영하는 뒷단 전체입니다. 기존 Responses API는 요청 한 번에 응답 한 번입니다. 몇 시간짜리 에이전트를 만들려면 작업 큐, 세션 상태를 저장할 DB, 샌드박스 풀, 재시도 정책을 개발자가 따로 구현해야 했습니다. 오픈소스 Agents SDK도 루프를 제공하지만 그 루프는 개발자 서버에서 돌았습니다.
이번에는 세션을 만드는 호출 하나로 이 부분을 OpenAI에 넘깁니다. 아래는 개발자용 예시 코드입니다.
session = client.beta.agents.sessions.create(
agent={
"model": "gpt-6-astra",
"tools": [{"type": "web_search"}, {"type": "programmatic_tool_calling"}],
"multi_agent": {"enabled": True, "max_concurrent_subagents": 4},
},
environment={"type": "openai_hosted"},
input="서비스 5xx 오류가 늘어난 원인을 찾아 /workspace/outputs에 정리해 줘",
)
진행 상황은 스트리밍이나 웹훅으로 받고 작업 중간에 지시를 추가할 수 있습니다. 하네스에 들어간 기능은 네 가지입니다.
- 자동 컨텍스트 압축: 세션이 모델의 컨텍스트 한도에 가까워지면 앞부분을 요약해 줄이고 작업을 이어 갑니다.
- 도구 검색: 도구 정의를 전부 넣지 않고 필요한 것만 불러와 토큰을 아낍니다.
- 코드로 도구 호출: 여러 도구 호출을 병렬로 돌리고 결과를 코드로 걸러 필요한 부분만 모델에 돌려줍니다.
- 하위 에이전트: 큰 작업을 하위 에이전트들이 나눠 맡아 각자 별도 컨텍스트에서 동시에 처리합니다. 예시 설정은 동시 3개에서 4개입니다.
도구로는 MCP 서버, 직접 정의한 함수, 웹 검색을 쓸 수 있습니다. 하네스 코드는 Apache-2.0 라이선스인 openai/codex 저장소에 공개돼 있어 동작을 직접 읽어 볼 수 있습니다.
도입 전후를 비교한 수치는 OpenAI 발표 페이지에 실린 고객 인용이 전부입니다. 기존에 자체 루프를 쓰던 Ciridae는 평가 점수가 0.71에서 0.85로 오르고 지연 시간이 4분의 1로 줄었다고 했습니다. SafetyKit은 건당 비용이 60%, Hypha는 실패 응답이 86% 줄었다고 밝혔습니다. 각 회사가 이전에 어떤 구성을 썼는지는 공개되지 않아 독립적으로 검증하기는 어렵습니다.
요금은 루프가 아니라 샌드박스에서 나옵니다
OpenAI는 Agents API 자체에 추가 요금이 없다고 밝혔습니다. 청구 항목은 모델 토큰, 웹 검색 같은 도구, OpenAI가 호스팅하는 샌드박스를 쓸 때의 컨테이너 시간입니다. 자체 인프라나 파트너 샌드박스(Blaxel, Cloudflare, Daytona, DigitalOcean, E2B, Modal, Oracle, Runloop, Vercel)를 고르면 컴퓨팅 비용은 그쪽에서 나갑니다.
호스팅 샌드박스 요금은 가격표에 20분 단위로 나와 있고 실제 과금은 분 단위로 최소 5분부터입니다. 공개 베타를 먼저 시작한 Anthropic의 Claude Managed Agents와 비교하면 다음과 같습니다.
| 항목 | OpenAI Agents API | Claude Managed Agents |
|---|---|---|
| 상태 | 공개 베타(2026년 9월 10일) | 공개 베타(2026년 4월) |
| 루프 운영 요금 | 없음 | 실행 중인 세션 시간당 0.08달러 |
| 호스팅 샌드박스 | 20분에 1GB 0.03달러, 4GB 0.12달러, 16GB 0.48달러, 64GB 1.92달러 | 위 0.08달러에 포함, 컨테이너 별도 과금 없음 |
| 대기 시간 | 제외 여부가 문서에 없음 | 유휴 상태는 과금 안 함 |
| 최상위 모델 토큰 | GPT-6 Astra 입력 10달러, 출력 50달러 | Claude Fable 5.1 입력 10달러, 출력 50달러 |
| 쓸 수 있는 모델 | OpenAI 모델 | Claude 모델 |
출처: OpenAI API 가격표, Claude API 가격 문서(2026-09-12 확인). 토큰 가격은 100만 토큰 기준.
한 시간짜리 세션에서 입력 5만 토큰, 출력 1만5000토큰을 쓴다고 가정해 계산해 보겠습니다. GPT-6 Astra와 Claude Fable 5.1은 토큰 단가가 같아서 토큰 비용은 양쪽 다 1.25달러입니다. 차이는 실행 환경 요금에서 납니다.
- GPT-6 Astra + OpenAI 4GB 샌드박스: 토큰 1.25달러 + 컨테이너 0.36달러 = 1.61달러입니다.
- Claude Fable 5.1 + Managed Agents: 토큰 1.25달러 + 런타임 0.08달러 = 1.33달러입니다.
1GB 샌드박스로 충분한 작업이라면 OpenAI 쪽 컨테이너 요금은 시간당 0.09달러로 Claude 런타임 요금과 거의 같아집니다. 메모리를 크게 잡을수록 OpenAI 쪽 비용이 올라갑니다. OpenAI 커뮤니티 공지 댓글에도 "컨테이너를 띄우기 전에 비용부터 계산하라, 비싸게 배웠다"는 경고가 달렸습니다.
베타 조건: 미국 저장, 무보존 계약 제외
조건은 한 가지를 빼면 넓게 열려 있습니다. 한국은 OpenAI API 지원 국가에 들어 있고 신청이나 대기자 명단도 없습니다.
| 항목 | 내용 |
|---|---|
| 대상 | OpenAI API 키가 있는 모든 개발자(공개 베타) |
| 가격 | Agents API 무료, 토큰·도구·호스팅 샌드박스 시간은 표준 요금 |
| 한국 사용 | 가능. 단 베타 동안 데이터 레지던시는 미국만 지원 |
| 무보존(ZDR) | 미지원. 자체 호스팅이나 파트너 샌드박스를 써도 동일 |
| SDK | client.beta.agents.sessions 네임스페이스(베타) |
빠진 한 가지는 데이터 위치와 보존입니다. 개요 문서는 베타 동안 미국 데이터 레지던시만 지원하고 ZDR(OpenAI가 요청 데이터를 저장하지 않는 계약)은 적용되지 않는다고 적었습니다. 샌드박스를 자기 서버에 두어도 세션 상태와 대화 기록은 OpenAI 쪽 하네스를 거칩니다. 이미 ZDR 계약을 맺고 OpenAI를 쓰는 기업이나 고객 데이터를 특정 지역에 둬야 하는 서비스라면 지금은 이 API에 운영 데이터를 넣을 수 없습니다.
Hacker News 댓글에서 가장 많이 나온 걱정은 업체 종속입니다. 한 사용자는 작년에 Assistants API 퇴역 공지를 받은 뒤로 상태를 서버에 저장하는 API는 쓰지 않는다고 적었습니다. Assistants API는 2026년 8월 26일 종료됐고 스레드를 자동으로 옮겨 주는 도구는 없었습니다. Agents API는 그로부터 보름 뒤에 나왔습니다. OpenAI 모델만 쓸 수 있다는 점도 지적됐습니다. AWS Bedrock AgentCore처럼 세션 도중 모델 회사를 바꾸는 선택지는 없습니다.
직접 만든 에이전트 루프를 운영 중인 팀이라면 가장 오래 걸리는 작업 하나를 environment.type: "self_hosted"로 Agents API에 옮겨 보세요. 같은 입력 20건으로 기존 루프와 완료율, 세션당 토큰, 재시도 횟수를 비교하면 됩니다. 자체 호스팅으로 두면 컨테이너 요금 없이 하네스만 비교할 수 있습니다. 운영에 넣을지는 그 숫자에 더해 미국 저장과 ZDR 미적용이 사내 데이터 규정에 맞는지 확인한 뒤에 정하면 됩니다.