Cognition의 SWE-2, Terminal-Bench 2.1에서 92.8 기록

(tokenstead.ai)
Hacker NewsAI 모델
Cognition의 SWE-2, Terminal-Bench 2.1에서 92.8 기록

Cognition이 공개한 SWE-2는 2.8조 파라미터 규모의 MoE 모델로, 코딩 에이전트의 성능을 극대화하면서도 기존 모델 대비 획기적인 비용 절감을 달성하여 AI 에이전트 시대의 새로운 경제적 기준을 제시합니다.

이 글의 핵심 포인트

  • 12.8T 총 파라미터 규모의 MoE 구조로, 104B의 활성 파라미터를 사용함
  • 2Terminal-Bench 2.1에서 92.8라는 최고 수준의 벤치마크 점수를 기록함
  • 3Claude Fable 5.1과 유사한 성능을 내면서도 비용은 64% 더 저렴함
  • 4SWE-1.7 대비 작업 단계(steps)를 줄이고 평균 비용을 81% 낮춤
  • 5현재 Devin Desktop 및 CLI를 통해 사용 가능하며, 모델 가중치는 비공개임

이 글에 대한 공공지능 분석

왜 중요한가?

AI 에이전트의 성능 지표가 단순한 텍스트 생성을 넘어, 실제 터미널 조작 및 코드 수정과 같은 '실행 가능한 능력'으로 이동하고 있음을 보여줍니다. 특히 대규모 모델을 MoE(Mixture of Experts) 구조로 구현하여 성능과 비용의 트레이드오프를 해결하려는 시도가 돋보입니다.

어떤 배경과 맥락이 있나?

기존 SWE-1.7 모델에서 한 단계 진화하여, 멀티-트릴리언 파라미터 규모에 강화학습(RL)을 확장 적용함으로써 에이전트의 행동 정확도를 높이는 기술적 흐름 속에 있습니다. 이는 모델의 지능뿐만 아니라 '에이전트적 사고(Agentic reasoning)'를 강화하는 데 집중하고 있음을 의미합니다.

업계에 어떤 영향을 주나?

고비용의 플래그십 모델을 사용하는 대신, 특정 태스크에 최적화된 저비용·고효율 에이전트 모델의 등장은 에이전트 기반 SaaS 스타트업들의 수익 구조를 근본적으로 개선할 것입니다. 이는 에이전트 서비스의 대중화와 확산을 가속화할 핵심 동력입니다.

한국 시장에 어떤 시사점이 있나?

한국의 개발자 도구 및 자동화 솔루션 스타트업들은 SWE-2와 같은 고성능 에기능 모델을 활용하여 글로벌 수준의 코딩 자동화 서비스를 빠르게 구축할 기회를 맞이했습니다. 모델 자체를 개발하기보다, 이러한 강력한 에이전트를 어떻게 워크플로우에 통합할지가 핵심 경쟁력이 될 것입니다.

이 글에 대한 큐레이터 의견

SWE-2의 등장은 AI 산업의 핵심 전장이 '지능의 높이'에서 '에이전트의 경제성'으로 이동하고 있음을 시사합니다. 단순히 똑똑한 모델을 만드는 것을 넘어, 얼마나 적은 비용과 단계(turn)로 복잡한 문제를 해결하느냐가 에이전트 서비스의 생존을 결정할 것입니다. 특히 64%에 달하는 비용 절감 수치는 에이전트 기반 워크플로우를 도입하려는 기업들에게 강력한 경제적 유인책이 됩니다.

하지만 주의 깊게 살펴봐야 할 리스크도 존재합니다. Terminal-Bench 4.0에서 보여준 낮은 점수는 SWE-2가 단기적인 명령 수행에는 능하지만, 긴 호흡이 필요한 복잡한 프로젝트 전체를 관리하는 'Long-horizon' 능력에는 여전히 한계가 있음을 나타냅니다. 따라서 스타트업 창업자들은 SWE-2를 만능 해결사로 신뢰하기보다는, 복잡한 태스크를 작은 단위로 분절하여 처리하는 오케스트레이션 전략을 병행하는 신중한 접근이 필요합니다.

원문 보기 →

관련 뉴스

댓글

아직 댓글이 없습니다. 첫 댓글을 남겨보세요.