AI 에이전트 뉴스
Claude, Cursor, OpenClaw, ChatGPT Agent 등 자율적으로 작업을 수행하는 AI 에이전트 동향과 활용 사례.
총 7,898건·최신 업데이트
- 961
저희 작은 팀이 터미널 벤치에서 클로드 코드와 코덱스를 능가했습니다.
캐나다 스타트업 Backboard의 CLI 에이전트가 Terminal-Bench 2.1 리더보드에서 Anthropic과 OpenAI의 공식 에이전트를 상회하는 85.4%의 점수를 기록했습니다. 이들은 모델 자체의 성능보다 에이전트의 계획, 위임, 컨텍스트 관리 능력이 실제 작업 성공률을 결정짓는 핵심 요소임을 강조하며 해당 기술을 오픈소스로 공개할 예정입니다.
Our small team just outscored Claude Code and Codex on Terminal-Bench↗dev.to
- 971
에이전트 컨텍스트 레이어: AI 데이터 거버넌스를 하는 기업은 그렇지 않은 기업보다 두 배 더 많은 잘못된 답변을 감지
101개 기업을 대상으로 한 조사 결과, AI 에이엇 응답 오류의 68%가 비즈니스 맥락의 누락이나 불일치에서 비롯된 것으로 나타났습니다. 특히 의미 체계를 운영하는 기업은 그렇지 않은 기업보다 훨씬 높은 수준으로 잘못된 답변을 감지해내고 있습니다.
Agent context layers: Enterprises governing their AI data are catching twice as many bad answers as the ones who aren't↗venturebeat.com
- 972
에이전트 보안: 기업들은 에이전트 권한을 두 thirds의 시간 동안 시행하고, 고위험 에이전트는 5분의 1 미만으로 격리
116개 기업을 대상으로 한 조사 결과, AI 에이전트 운영 과정에서 보안 사고나 근접 위협을 경험한 기업이 53%에 달하는 것으로 나타났습니다. 많은 기업이 권한 제한을 시도하고 있으나, 고위험 에이전트 격리나 자격 증명 공유 문제 등 핵심적인 컨테인먼트(Containment) 영역에서의 보안 수준은 여전히 매우 취약한 상태입니다.
Agentic security: Enterprises enforce agent permissions two-thirds of the time — and isolate high-risk agents less than one in five↗venturebeat.com
- 973
에이전트 오케스트레이션: 기업 AI 조직은 에이전트 거버넌스 방법을 알고 있지만, 그 비용을 측정하지 못한다.
107개 기업 조사 결과, 기업들은 단일 플랫폼에 의존하기보다 유연성 확보를 위해 여러 오케스트레이션 플랫폼을 동시에 운영하는 하이브리드 방식을 채택하고 있습니다. 현재 사용량은 Microsoft가 앞서고 있지만, 미래 기술 고려 사항에서는 Anthropic이 우위를 점하고 있는 것으로 나타났습니다.
Agentic orchestration: Enterprise AI organizations know how to govern agents but still can't meter what they cost↗venturebeat.com
- 974
에이전트 신뢰도 및 평가: 부실한 평가로 피해를 본 기업일수록 인간 개입을 줄이는 경향이 있다.
최근 조사 결과 AI 에이전트 자동 평가를 신뢰하는 기업 비중이 5%에서 13%로 크게 늘었지만, 평가를 통과한 에이전트가 실제 고객 응대에서 실패하는 비율은 여전히 절반 이상을 차지합니다. 특히 부실한 평가로 피해를 본 기업들이 오히려 인간의 개입을 줄이는 경향을 보여 자동화된 평가의 신뢰도와 실질적 성능 사이의 괴리가 심각한 문제로 나타났습니다.
Agentic reliability and evaluations : Enterprises that got burned by a bad eval are the most likely to remove humans from the loop, not the least↗venturebeat.com
- 977
Show HN: Parley – 당신의 코딩 에이전트가 동료의 에이전트와 대화할 수 있습니다
Parley는 Claude Code, Cursor 등 다양한 AI 코딩 에이전트들이 서로 작업을 주고받고 기록을 남길 수 있도록 지원하는 에이전트 협업 플랫폼입니다. 비동기 메시징, 파일 충돌 방지를 위한 소프트 락, 그리고 작업 지연 시 인간에게 알림을 보내는 에스컬레이션 기능을 통해 에이전트 중심의 개발 환경 구축을 목표로 합니다.
Show HN: Parley – your coding agent can talk to a teammate's agent↗parley.weldra.dev













