Dev.to 뉴스
총 16,617건·최신 업데이트
- 1806
LoCoMo 메모리 벤치마크에서 99.95% 달성했습니다. 하지만 함정이 있고, 여전히 중요한 이유가 있습니다.
본 기사는 LoCoMo 벤치마크에서 99.95%의 성능을 달성한 사례를 통해, RAG 대신 모델 가중치에 직접 정보를 학습시키는 '파라메트릭 메모리' 방식의 가능성을 다룹니다. LoRA와 양자화 기술 덕분에 저비용으로 구현 가능한 이 방식은 토큰 비용 절감과 데이터 격리 보안이라는 강력한 이점을 제공합니다.
We hit 99.95% on the LoCoMo memory benchmark. Here's the catch, and why it still matters.↗dev.to
- 1811
중국 AI 모델, 기업 API 트래픽의 최대 46% 차지 – 그 이유는 (2026)
OpenRouter 데이터에 따르면 DeepSeek와 Qwen 등 중국계 모델이 전체 토큰 사용량의 상당 부분을 차지하며 미국 모델을 추월하고 있습니다. 이는 에이전트 기반 워크로드 증가로 인해 비용 효율성이 핵심 지표가 되었기 때문이며, 개발자들은 작업 난이도에 따라 모델을 분리 사용하는 전략을 채택하고 있습니다.
Chinese AI Models Now Power Up to 46% of Enterprise API Traffic — Here's Why (2026)↗dev.to
- 1812
Backboard CLI: 터미널 벤치마크 2.1에서 85.4%, 공식 리더보드 제출
Backboard CLI가 최신 터미널 벤치마크인 Terminal-Bench 2.1에서 Anthropic과 OpenAI의 에이전트를 앞지르는 압도적인 성능을 기록했습니다. 이는 특정 모델에 종속되지 않고 작업 분해와 컨텍스트 관리를 최적화한 '하네스(Harness)' 기술의 승리로 평가받으며, Backboard는 해당 CLI를 곧 오픈소스로 공개할 예정입니다.
Backboard CLI: 85.4% on Terminal-Bench 2.1, submitted to the official leaderboard↗dev.to
- 1813
Bumblebee: 퍼플렉시티의 무료 스캐너, 2026년 npm을 공격하는 공급망 공격 대응
2026년 axios와 Mastra AI 사례처럼 신뢰받는 라이브러리의 계정 탈취를 통한 공급망 공격이 급증함에 따라, Perplexity가 보안 스캐너 Bumblebee를 오픈소스로 공개했습니다. 이 도구는 코드를 실행하지 않고 메타데이터만 읽어 npm, PyPI 등 다양한 생태계의 악성 패키지 포함 여부를 신속하게 점검합니다.
Bumblebee: Perplexity's Free Scanner for the Supply Chain Attacks Hitting npm in 2026↗dev.to
- 1814
저희 작은 팀이 터미널 벤치에서 클로드 코드와 코덱스를 능가했습니다.
캐나다 스타트업 Backboard의 CLI 에이전트가 Terminal-Bench 2.1 리더보드에서 Anthropic과 OpenAI의 공식 에이전트를 상회하는 85.4%의 점수를 기록했습니다. 이들은 모델 자체의 성능보다 에이전트의 계획, 위임, 컨텍스트 관리 능력이 실제 작업 성공률을 결정짓는 핵심 요소임을 강조하며 해당 기술을 오픈소스로 공개할 예정입니다.
Our small team just outscored Claude Code and Codex on Terminal-Bench↗dev.to
- 1818
Canva와 Snappa, 저렴한 소셜 미디어 그래픽 제작을 위해 30일간 직접 사용해본 결과: 2026년
30일간의 실사용 테스트를 통해 Canva와 Snascape의 성능, 비용, 기능적 차이를 심층 비교했습니다. Canva는 AI 도구와 스케줄링 기능을 포함한 종합 플랫폼으로서 압도적인 우위를 점하고 있는 반면, Snappa는 단순하고 빠른 작업이 필요한 사용자에게 적합한 니치 시장을 타겟팅하고 있습니다.
Canva vs Snappa for Social Media Graphics on a Budget 2026: I Ran Both for 30 Days↗dev.to













