AI 모델 (LLM·GPT·Claude·Gemini)
GPT, Claude, Gemini, Llama 등 AI 모델(LLM) 출시·벤치마크·API 변경사항을 모읍니다.
최신 업데이트
AI 모델 관련 글 — 216 페이지
- 6
미스터리한 Hy3 LLM, OpenRouter 모델 랭킹에서 압도적인 우위를 점하다
최근 OpenRouter 데이터에 따르면 텐센트의 오픈소스 모델 Hy3가 성능이 더 높은 Claude를 제치고 토큰 사용량 부문에서 압도적인 우위를 점하고 있습니다. Hy3는 DeepSeek보다도 저렴한 가격을 무기로, 대규모 입력 토큰 처리가 필요한 에이전트 및 RAG 서비스들 사이에서 유기적인 사용량 증가를 보여주고 있습니다.
The mysterious Hy3 LLM is topping OpenRouter Model Rankings by a large margin↗minimaxir.com
- 9
$16/월 DigitalOcean GPU Droplet에서 vLLM + 4-bit Quantization으로 Grok-2 배포하기: Claude Opus 비용의 1/130 수준의 추론
이 기사는 DigitalOcean의 저렴한 GPU Droplet을 활용하여 Grok-2 모델을 직접 배포함으로써 Claude Opus와 같은 고가의 상용 API 대비 획기적인 비용 절감을 달성하는 방법을 다룹니다. vLLM과 4비트 양자화 기술을 사용하여 월 16달러 수준의 인프라 비용만으로 무제한 추론이 가능한 생산 환경 구축 프로세스를 상세히 설명합니다.
How to Deploy Grok-2 with vLLM + 4-bit Quantization on a $16/Month DigitalOcean GPU Droplet: Reasoning at 1/130th Claude Opus Cost↗dev.to
- 10
1M 컨텍스트 윈도우 LLM 2026: Gemini 2.5 Pro vs Claude Sonnet 4.6 실전 테스트
Gemini 2.5 Pro와 Claude Sonnet 4.6 모델을 대상으로 95만 토큰의 대규모 코드베이스를 활용한 실전 성능 비교를 진행했습니다. 100만 토큰 컨텍스트 윈도우의 실제 구현 능력인 정보 검색 품질, 응답 지연 시간, 비용 효율성 및 대규모 데이터 처리 시의 모델 붕괴 여부를 중점적으로 다룹니다.
1M Context Window LLM 2026: Gemini 2.5 Pro vs Claude Sonnet 4.6 Real Test↗dev.to
- 12
LLM, 명시적 경고에도 불구하고 허위 진술을 믿는다
최신 연구에 따르면 LLM은 학습 데이터에 '이 내용은 거짓이다'라는 명시적 경고가 포함되어 있어도 통계적 패턴을 우선시하여 허위 정보를 사실로 학습하는 '부정 무시' 현상을 보입니다. 이는 모델의 미세 조정(Fine-tuning) 과정에서 허위 정보가 모델의 내부 표현에 깊게 각인되어 단순한 부정 문구만으로는 이를 바로잡기 어렵다는 것을 시사합니다.
LLMs believe false statements even after explicit warnings that they're false↗arstechnica.com
- 17
오버샘플링 없이 EQ 주파수 제약을 없쵀는 방법 — (DAFx26 논문)
전통적인 biquad 필터의 고주파수 왜곡 문제를 해결하기 위해 오버샘플링 대신 수학적 프리워핑(Pre-warping)을 적용한 Simper SVF 구조를 소개합니다. 이 기술은 CPU 부하를 최소화하면서도 정확한 이득(Gain)을 유지하며, 락프리(Lock-free) 아키텍처와 가변 주기 계수 엔진을 통해 실시간 오디오 처리의 효율성을 극대화했습니다.
We Eliminated EQ Frequency Cramping Without Oversampling — Here's How (DAFx26 Paper)↗dev.to
- 18
Hytale 보물 사냥, 잘못된 런타임에 의존하여 깨졌던 이유
JVM 기반의 게임 엔진이 대규모 데이터 처리 과정에서 발생하는 Direct Memory 누수와 과도한 GC(Garbage Collection)로 인해 동시 접속자 수 확장에 실패하자, 이를 Rust로 재설계하여 문제를 해결한 사례입니다. Rust의 Arena Allocator와 Zero-copy 파싱 기술을 통해 메모리 사용량을 3배 줄이고 P99 지연 시간을 32ms에서 8ms로 대폭 개선했습니다.
Why Hytale Treasure Hunts Fractured When We Trusted the Wrong Runtime↗dev.to
- 19
애플, 새로운 Siri 구동 위해 아이폰에 거대한 Gemini 모델 탑재 추진
애플은 대규모 언어 모델(LLM)의 성능을 확보하기 위해 구글의 제미나이 모델을 Siri에 통합하는 하이브리드 방식을 추진 중입니다. 이는 온디바이스 AI의 물리적 한계를 클라우드 기반의 강력한 모델로 보완하되, 엔비디아의 보안 컴퓨팅 기술을 통해 개인정보 보호라는 애플의 핵심 가치를 유지하려는 전략입니다.
Apple working to cram massive Gemini model into iPhone to power new Siri↗arstechnica.com
- 22
앤스로픽, 새로운 '동적 워크플로우' 도구와 함께 Opus 4.8 출시
앤스로픽이 모델의 신뢰성을 높인 Opus 4.8과 대규모 복합 작업을 수행하는 '동적 워크플로우(Dynamic Workflows)' 기능을 발표했습니다. 이번 업데이트는 모델이 불확실한 데이터를 스스로 식별하는 능력을 강화하고, 수백 개의 에이전트를 동시에 관리하여 대규모 코드베이스 마이그레이션까지 가능하게 하는 데 초점을 맞추고 있습니다.
Anthropic releases Opus 4.8 with new ‘dynamic workflow’ tool↗techcrunch.com
- 23
Claude의 새 모델, 실수를 할 때 더욱 ‘솔직’해졌습니다.
앤스로픽이 새로운 모델인 Claude Opus 4.8을 출시하며, AI의 고질적인 문제인 '환각'을 줄이기 위해 불확실성을 스스로 인지하고 알리는 '정직성' 강화에 집중했습니다. 또한 사용자가 작업의 정밀도를 직접 조절할 수 있는 기능과 수백 개의 서브 에이전트를 동시에 구동하는 '다이내믹 워크플로우'를 도입하여 복잡한 업무 자동화의 가능성을 넓혔습니다.
Claude’s new model is more ‘honest’ when it messes up↗theverge.com













