프롬프트 엔지니어링 뉴스
LLM 프롬프트 설계, 시스템 프롬프트, 컨텍스트 엔지니어링, 프롬프트 인젝션 방어 등에 관한 글.
총 2,058건·최신 업데이트
- 222
Backboard CLI: 터미널 벤치마크 2.1에서 85.4%, 공식 리더보드 제출
Backboard CLI가 최신 터미널 벤치마크인 Terminal-Bench 2.1에서 Anthropic과 OpenAI의 에이전트를 앞지르는 압도적인 성능을 기록했습니다. 이는 특정 모델에 종속되지 않고 작업 분해와 컨텍스트 관리를 최적화한 '하네스(Harness)' 기술의 승리로 평가받으며, Backboard는 해당 CLI를 곧 오픈소스로 공개할 예정입니다.
Backboard CLI: 85.4% on Terminal-Bench 2.1, submitted to the official leaderboard↗dev.to
- 223
저희 작은 팀이 터미널 벤치에서 클로드 코드와 코덱스를 능가했습니다.
캐나다 스타트업 Backboard의 CLI 에이전트가 Terminal-Bench 2.1 리더보드에서 Anthropic과 OpenAI의 공식 에이전트를 상회하는 85.4%의 점수를 기록했습니다. 이들은 모델 자체의 성능보다 에이전트의 계획, 위임, 컨텍스트 관리 능력이 실제 작업 성공률을 결정짓는 핵심 요소임을 강조하며 해당 기술을 오픈소스로 공개할 예정입니다.
Our small team just outscored Claude Code and Codex on Terminal-Bench↗dev.to
- 224
스칸 AI, 직원들의 실제 업무 방식을 관찰하는 것이 엔터프라이즈 AI의 핵심이라고 판단하며 6300만 달러 투자 유치
Skan AI가 Cathay Innovation과 Dell Technologies Capital의 주도로 6300만 달러 규모의 시리즈 C 투자 라운드를 성공적으로 마쳤습니다. 이 회사는 기업 내 소프트웨어 사용 방식을 관찰하여 업무 프로세스를 데이터화하는 '업무 컨텍스트 그래프' 기술을 통해 엔터프라이즈 AI 솔루션을 제공합니다.
Skan AI raises $63 million betting that watching how employees actually work is the missing layer of enterprise AI↗venturebeat.com
- 227
에이전트 컨텍스트 레이어: AI 데이터 거버넌스를 하는 기업은 그렇지 않은 기업보다 두 배 더 많은 잘못된 답변을 감지
101개 기업을 대상으로 한 조사 결과, AI 에이엇 응답 오류의 68%가 비즈니스 맥락의 누락이나 불일치에서 비롯된 것으로 나타났습니다. 특히 의미 체계를 운영하는 기업은 그렇지 않은 기업보다 훨씬 높은 수준으로 잘못된 답변을 감지해내고 있습니다.
Agent context layers: Enterprises governing their AI data are catching twice as many bad answers as the ones who aren't↗venturebeat.com
- 229
GitHub Copilot을 MITM 프록시 뒤에 배치하면서 얻은 것들
저자는 MITM 프록시를 이용해 GitHub Copilot과 같은 Electron 기반 AI 앱의 네트워크 트래픽을 분석하며, AI 기능이 내부적으로 어떻게 작동하는지 역공학했습니다. 특히 Chromium과 Node.js의 네트워크 스택 차이를 활용해 데이터 흐름을 추적하며, AI 서비스에서 '컨텍스트'가 제품의 핵심 요소로 진화하고 있음을 보여줍니다.
What I learned by putting GitHub Copilot behind a MitM proxy↗lighthousenewsletter.com
- 233
우리의 SDK, 사용자 답변을 캐시하고 다음 사용자가 질문할 때 제공했습니다.
AcruxCore SDK에서 프롬프트 템플릿의 입력 변수가 캐시 키에 포함되지 않아 서로 다른 질문에 동일한 답변이 반환되던 버그와, TTL을 0으로 설정했을 때 오히려 영구적으로 오래된 데이터를 제공하던 논리적 오류가 수정되었습니다. 이번 패치는 데이터 무결성을 보장하고 개발자의 의도대로 캐싱 제어를 가능하게 합니다.
Our SDK Cached One User's Answer and Served It to the Next One Who Asked↗dev.to
- 235
미출시 Anthropic 모델, 수학 최대 미해결 문제 중 하나에서 진전
Anthropic은 미출시 모델이 60개의 서브 에이전트를 활용해 리만 가설의 해법 하한선을 높이는 유의미한 진전을 이뤄냈다고 발표했습니다. 이번 성과는 전문 지식이 없는 사용자의 프롬프트와 AI 에이전트 간의 협업을 통해 3,100만 토큰 규모의 자율적 탐색으로 이루어졌습니다.
An unreleased Anthropic model made progress on one of math’s biggest unsolved problems↗techcrunch.com
- 237
SpaceXAI의 Grok Bot, 월 120달러로 앱을 실행하는 지속적인 디지털 협업자 탄생
스페이스XAI가 사용자가 지정한 소프트웨어와 웹사이트 내에서 자율적으로 작업을 수행하는 'Grok Bot'의 초기 베타 버전을 공개했습니다. 이 봇은 매번 프롬프트를 입력할 필요 없이 특정 업무를 할당받아 지속적으로 실행되는 디지털 협업자 역할을 목표로 합니다.
SpaceXAI's Grok Bot turns agents into persistent digital coworkers that can operate your apps for $120-per-month↗venturebeat.com










