런칭 HN: 토큰리스 (YC S26) - 비용 절감을 위한 자동 모델 전환

(usetokenless.com)
런칭 HN: 토큰리스 (YC S26) - 비용 절감을 위한 자동 모델 전환

YC S26 스타트업 Tokenless는 요청의 복잡도에 따라 최적의 LLM을 자동으로 선택하고 불필요한 모델 호출을 중단함으로써, 성능 저하 없이 AI 추론 비용을 최대 절반까지 절감할 수 있는 혁신적인 API 라우팅 솔루션을 선보였습니다.

이 글의 핵심 포인트

  • 1YC S26에 선정된 Tokenless는 AI 추론 비용을 최대 50%까지 절감하는 모델 라우터임
  • 2OpenAI 및 Anthropic과 호환되는 엔드포인트를 제공하여 기존 API 호출의 드롭인 교체 가능
  • 3요청을 여러 모델로 분산(Fan-out)시킨 후, 최적의 모델이 확인되면 나머지 프로세스를 취소하는 방식 채택
  • 4Google DeepMind, Princeton, UC Berkeley 출신의 AI 연구원들이 설립한 팀임
  • 5벤치마크 결과, 특정 태스크에서 고가의 프론티어 모델 대비 훨씬 낮은 비용으로 유사한 해결률(Solve rate) 달성 가능

이 글에 대한 공공지능 분석

왜 중요한가?

LLM 도입 기업의 가장 큰 병목인 '추론 비용' 문제를 해결하려 하기 때문입니다. 단순한 프롬프트 엔지니어링을 넘어 인프라 계층에서 자동화된 비용 최적화를 제공한다는 점이 핵심입니다.

어떤 배경과 맥락이 있나?

현재 AI 서비스는 고성능 모델(Frontier Models)에 대한 의존도가 높지만, 모든 태스크에 최고 사양의 모델이 필요하지는 않습니다. 이에 따라 효율적인 모델 라우팅 기술인 'Model Cascading' 개념을 상용화된 API 형태로 구현하여 비용 효율성을 극대화하려는 시도가 늘고 있습니다.

업계에 어떤 영향을 주나?

개발자가 모델 교체나 복잡한 로직 구현 없이도 즉각적인 비용 절감을 얻을 수 있어, AI 에이전트 및 고비용 LLM 기반 서비스의 수익성(Unit Economics) 개선에 큰 기여를 할 것입니다.

한국 시장에 어떤 시사점이 있나?

글로벌 수준의 높은 추론 비용을 부담해야 하는 국내 AI 스타트업들에게 Tokenless와 같은 라우팅 솔루션은 서비스 스케일업 단계에서 인프라 효율성을 결정짓는 중요한 선택지가 될 수 있습니다.

이 글에 대한 큐레이터 의견

Tokenless는 '성능 유지'와 '비용 절감'이라는 상충하는 두 목표를 인프라 레벨에서 해결하려는 영리한 접근을 보여줍니다. 특히 개발자가 기존 API 호출 방식을 거의 바꾸지 않고도(drop-in replacement) 즉각적인 비용 이득을 얻을 수 있다는 점은 운영 효율성을 극대화해야 하는 초기 스타트업에게 매우 강력한 셀링 포인트입니다.

하지만 리스크도 분명합니다. 여러 모델에 요청을 동시에 보내는 'Fan-out' 방식은 특정 상황에서 오히려 레이턴시(Latency)를 증가시키거나, 예측 불가능한 비용 변동성을 초래할 수 있습니다. 또한 모든 요청이 라우팅되는 과정에서 발생할 수 있는 데이터 프라이버시 및 보안 이슈에 대한 검증도 선행되어야 합니다. 따라서 창업자들은 단순 비용 절감뿐만 아니라 서비스의 응답 속도 민감도와 데이터 규제 준수 여부를 종합적으로 고려하여 도입 여부를 결정해야 합니다.

원문 보기 →

댓글

아직 댓글이 없습니다. 첫 댓글을 남겨보세요.