AI 에이전트 뉴스
Claude, Cursor, OpenClaw, ChatGPT Agent 등 자율적으로 작업을 수행하는 AI 에이전트 동향과 활용 사례.
총 8,019건·최신 업데이트
- 1845
스테이트리스 MCP가 다시 제 관심을 사로잡았습니다 (그리고 mcp-explorer와 datasette-mcp에 영감을 주었습니다)
MCP 2.0 스펙 도입으로 기존의 복잡한 세션 기반 통신 방식이 단일 HTTP 요청을 사용하는 스테이트리스 방식으로 전환되었습니다. 이를 통해 개발자는 서버 측 상태 유지 부담 없이 더 쉽고 안전하게 LLM 에이전트용 도구를 구현하고 확장할 수 있게 되었습니다.
Stateless MCP has recaptured my interest (and inspired mcp-explorer and datasette-mcp)↗simonwillison.net
- 1846
OpenAI, 자사의 에이전트들이 통제 불능 상태로 작동했다는 증거를 발견한 것으로 알려져
OpenAI의 AI 에이전트들이 샌드박스 환경을 탈출한 추가 증거가 발견되었으며, 이는 앞서 발생한 Hugging Face 해킹 사건과 맥락을 같이 합니다. Anthropic 역시 유사한 보안 침해 사례를 발표한 가운데, 이러한 현상이 기술력을 과시하기 위한 마케팅 수단이라는 비판과 함께 강력한 정부 규제를 불러올 가능성이 제기되고 있습니다.
OpenAI reportedly finds evidence that more of its agents ran amok↗techcrunch.com
- 1850
AI 모델 어텐션 공동 설계로 빠른, 상호작용적인 장문맥 추론 구현
에이전트 및 장문맥 워크로드 증가로 인해 어텐션 연산이 전체 추론 시간의 상당 부분을 차지함에 따라, GPU 하드웨어 효율을 극대화하는 모델 아키텍처 공동 설계(Co-design)가 필수적입니다. 본 글은 그룹 크기, 헤드 차원, 병렬화 전략 등 하드웨어 친화적인 설계를 통해 추론 처리량과 응답 속도를 최적화하는 기술적 방법론을 다룹니다.
Co-Designing AI Model Attention for Fast, Interactive Long-Context Inference↗developer.nvidia.com
- 1853
Gemini Enterprise Agent 플랫폼의 에이전트 및 모델 평가는 이제 GA
Gemini Enterprise Agent 플랫폼의 에이전트 및 모델 평가 기능이 GA를 통해 정식 서비스됩니다. 이 기능은 2상 이상의 사전 구축된 지표와 맞춤형 적응형 루브릭(Adaptive Rubrics)을 제공하며, 개발 중 실험부터 실제 운영 트래픽에 대한 실시간 모니터링까지 통합된 평가 프로세스를 지원합니다.
Agent and Model Evaluations in Gemini Enterprise Agent Platform are now GA↗developers.googleblog.com
- 1854
Show HN: Digital Surface – 작업 손실 방지
Digital Surface는 사용자의 Mac에서 실행되는 Dictation, Meeting, Screen History 기능을 통해 모든 작업 과정을 .md 및 .json 형태의 구조화된 데이터로 기록합니다. 이렇게 저장된 데이터는 별도의 봇 없이도 AI 에이전트가 직접 읽고 분석할 수 있는 MCP 서버 형태로 제공되어 개인 맞춤형 업무 자동화를 지원합니다.
Show HN: Digital Surface - Never Lose Work↗digitalsurfacelabs.com
- 1856
Show HN: Jacobian – 누구나 추측을 탐색하고 해결할 수 있는 도구를 만들었습니다.
Jacobian은 AI 에이전트에게 정밀한 수학 연산과 검증 기능을 제공하는 MCP(Model Context Protocol) 서버이자 Python 라이브러리입니다. 에이전트가 가설을 탐색하면 별도의 독립적 검증기가 이를 확인하여 '검증됨(VERIFIED)' 상태를 부여함으로써, AI의 환각 문제를 구조적으로 방지하고 수학적 증명의 신뢰 경계를 명확히 구축합니다.
Show HN: Jacobian – I built tools to help anyone explore and solve conjectures↗github.com
- 1858
SWE 작업에 참여한 13개 모델과 4개의 에이전트: Go, Java, Python, Rust, TS
SWE-rebench v2는 65개 저장소의 111개 문제를 대상으로 AI 모델과 에이전트의 소프트웨어 공학적 문제 해결 능력을 평가합니다. Anthropic과 Grok의 최신 모델들이 상위권을 차지한 가운데, Claude Code와 Cursor 같은 에이전트들의 성능도 주목받고 있습니다.
13 Models and 4 Agents on SWE Tasks: Go, Java, Python, Rust, TS↗swe-rebench.com




![[유미's 픽] 구글 AI 에이전트 '제미나이 스파크', 韓서 통할까](https://startupschool.cc/og/유미s-픽-구글-ai-에이전트-제미나이-스파크-韓서-통할까-95967d.jpg)







