OpenAI Responses API, AI Gateway에서 WebSocket 지원 시작

(vercel.com)
Vercel BlogAI 모델
OpenAI Responses API, AI Gateway에서 WebSocket 지원 시작

Vercel AI Gateway가 OpenAI Responses API에 대한 WebSocket 지원을 시작하며, 대규모 도구 호출이 필요한 에이전트 작업의 실행 속도를 최대 40%까지 개선하여 AI 애플리케이션의 응답 성능과 효율성을 혁신할 것으로 기대됩니다.

이 글의 핵심 포인트

  • 1Vercel AI Gateway가 OpenAI Responses API에 대한 WebSocket 모드 지원을 시작함
  • 2전체 컨텍스트를 재전송하는 대신 새로운 입력과 previous_response_id만 전송하여 효율성 증대
  • 320개 이상의 도구 호출이 포함된 에이전트 작업 시 엔드투엔드 실행 속도를 최대 약 40%까지 향상 가능
  • 4OpenAI의 WebSocket 모드 사양을 따르며, Zero Data Retention(ZDR) 및 store=false 설정과 호환됨
  • 5GET /v1/responses 엔드포인트를 통해 지속적인 연결을 통한 응답 생성 지원

이 글에 대한 공공지능 분석

왜 중요한가?

AI 애플리케이션의 핵심 과제인 '지연 시간(Latency)'과 '데이터 전송 효율성'을 동시에 해결할 수 있는 기술적 진보입니다. 매번 전체 대화 맥락을 다시 보내야 했던 기존 HTTP 방식의 오버헤드를 줄여, 더 빠르고 매끄러운 사용자 경험을 가능하게 합니다.

어떤 배경과 맥락이 있나?

최근 AI 트렌드는 단순 챗봇을 넘어 여러 도구를 사용하는 '에이전틱(Agentic) 워크플로우'로 이동하고 있습니다. 에이전트가 수십 개의 도구 호출을 수행할 때 발생하는 누적된 네트워크 비용과 지연 시간은 서비스 확장의 병목 구간으로 작용해 왔습니다.

업계에 어떤 영향을 주나?

에이전트 기반 AI 서비스를 개발하는 기업들에게는 운영 비용 절감과 성능 향상이라는 두 마리 토끼를 잡을 기회입니다. 특히 WebSocket을 통한 상태 유지(Stateful) 방식의 도입은 실시간성이 중요한 AI 에이전트 서비스의 표준 사양을 변화시킬 수 있습니다.

한국 시장에 어떤 시사점이 있나?

글로벌 시장을 타겟으로 하는 한국의 AI SaaS 스타트업들은 인프라 최적화만으로도 강력한 경쟁 우위를 확보할 수 있습니다. Vercel과 같은 글로벌 게이트웨이의 신기능을 빠르게 도입하여, 저지연(Low-latency) 성능을 기반으로 한 차별화된 에이전트 서비스를 구축해야 합니다.

이 글에 대한 큐레이터 의견

이번 업데이트는 '에이전틱 AI' 시대의 인프라가 어떻게 진화해야 하는지를 보여주는 중요한 이정표입니다. 단순한 기능 추가를 넘어, 상태를 유지하는(Stateful) 연결을 통해 LLM 응답의 효율성을 극대화하려는 시도이기 때문입니다. 이는 개발자가 복잡한 에이전트 로직을 구현할 때 고려해야 할 네트워크 아키텍처의 패러다임을 바꿀 수 있습니다.

물론 트레이드오프도 존재합니다. WebSocket은 HTTP와 달리 지속적인 연결을 유지해야 하므로, 서버 측의 커넥션 관리 부담이 늘어나고 연결 불안정 시 재연결 로직(Reconnection logic)을 정교하게 설계해야 하는 운영 복잡성이 따릅니다. 즉, 성능 이득만큼이나 인프라의 안정성을 관리하는 비용도 증가할 수 있습니다.

스타트업 창업자들은 단순히 모델의 성능에만 집중할 것이 아니라, 이러한 게이트웨이 레벨의 최적화 기술을 적극적으로 모니터링해야 합니다. 특히 다단계 도구 호출(Multi-step tool use)이 핵심인 서비스를 기획 중이라면, 초기 설계 단계부터 WebSocket 지원 여부를 고려하여 서비스의 확장성과 응답 속도를 선제적으로 확보하는 전략이 필요합니다.

원문 보기 →

댓글

아직 댓글이 없습니다. 첫 댓글을 남겨보세요.