AI 모델 (LLM·GPT·Claude·Gemini)
GPT, Claude, Gemini, Llama 등 AI 모델(LLM) 출시·벤치마크·API 변경사항을 모읍니다.
최신 업데이트
AI 모델 관련 글 — 218 페이지
- 6
Nvidia Vera CPU 벤치마크: 올림푸스 코어가 뛰어난 성능을 제공
NVIDIA의 차세대 ARM 기반 CPU인 Vera는 자체 설계한 Olympus 코어를 탑재하여 이전 세대 대비 2배의 성능과 높은 에너지 효율을 제공합니다. 특히 에이전틱 AI 워크로드를 위해 설계되었으며, 강력한 메모리 대역폭과 최신 인터페이스(PCIe Gen 6, CXL 3.1)를 지원하여 데이터센터의 성능 혁신을 주도할 전망입니다.
Nvidia Vera CPU Benchmarks: Olympus Cores Delivering Great Performance↗phoronix.com
- 12
Qwen 3.7로 복잡한 AI 에이전트 실행하기: 1.32달러로 해결한 인프라 악몽
Qwen 3.7을 활용해 기존 플래그십 모델 대비 약 4배의 비용 절감이 가능함을 보여주며, 모델 전환 시 발생하는 인프라 관리의 어려움을 지적합니다. 이를 해결하기 위해 모델 간 심리스한 전환과 장애 복구를 지원하는 PendasRouter라는 API 라우팅 솔루션을 제안합니다.
I Ran a Complex AI Agent for $1.32 Using Qwen 3.7 (And How I Fixed the Infra Nightmare)↗indiehackers.com
- 16
$5/월 DigitalOcean Droplet에서 Ollama + FastAPI로 Phi-3.5 Vision 배포하는 방법: GPT-4 Vision 비용의 1/220 수준의 경량 멀티모달 추론
고비용의 멀티모달 AI API 대신 월 30달러 수준의 저렴한 클라우드 서버에 Phi-3.5 Vision 모델을 구축하는 구체적인 방법을 다룹니다. Ollama와 FastAPI를 활용하여 비용 효율적이고 제어 가능한 자체 AI 추론 인프라를 구축하는 기술적 절차와 하드웨어 권장 사양을 제시합니다.
How to Deploy Phi-3.5 Vision with Ollama + FastAPI on a $5/Month DigitalOcean Droplet: Lightweight Multimodal Inference at 1/220th GPT-4 Vision Cost↗dev.to
- 17
.NET 데스크톱 앱에 Gemma 4 음성 인식 추가하기: llama-server 사이드카가 살아남은 방법
이 글은 .NET 환경에서 Gemma 4 음성 인식 엔진을 구현하기 위한 4가지 기술적 시도와 실패 과정을 상세히 분석합니다. 개발자는 ONNX Runtime의 구조적 미지원과 Python 환경의 배포 복잡성을 피하기 위해, 최종적으로 llama-server를 독립된 프로세스로 활용하는 사이드카 아키텍처를 구축하여 안정적인 온디바이스 추론을 구현했습니다.
Adding Gemma 4 speech recognition to a .NET desktop app: the llama-server sidecar that survived↗dev.to
- 18
헤르메스 에이전트, 글로벌 토큰 사용 주도. 도대체 무슨 뜻일까?
OpenRouter 랭킹에서 압도적인 토큰 사용량을 기록한 Hermes Agent의 사례는 AI 산업이 단순 챗봇에서 자율형 에이전트로 이동하고 있음을 보여줍니다. 에이전트 시대에는 토큰 소비량이 작업의 정확도가 아닌 복잡한 프로세스와 반복적 루프를 의미할 수 있으므로, 새로운 성과 지표와 비용 효율적인 설계가 핵심 과제로 떠오르고 있습니다.
Hermes Agent Leads Global Token Use. What Does That Actually Mean?↗dev.to
- 20
노트북LM-py: Google NotebookLM을 프로그래밍 가능한 API로, Claude Code 통합하여 전환 (매일 공개 소스 프로젝트 하나)
구글 NotebookLM의 내부 API를 역공학하여 개발된 notebooklm-py는 Python과 CLI를 통해 NotebookLM의 강력한 지식 관리 기능을 자동화할 수 있게 해줍니다. 특히 Claude Code와의 통합을 통해 Gemini의 근거 있는 지식 검색 능력과 Claude의 정교한 추론 능력을 결합한 하이브리드 AI 에이전트 구축이 가능해집니다.
One Open Source Project a Day (No. 77): notebooklm-py - Turning Google NotebookLM Into a Programmable API, With Claude Code Integration↗dev.to
- 22
Lynkr vs LiteLLM vs OpenRouter vs PortKey: 2026년 LLM 게이트웨이 선택하기
LLM 서비스의 비용 급증과 특정 제공업체에 대한 종속성 문제를 해결하기 위한 4가지 LLM 게이트웨이를 비교 분석합니다. 각 도구는 설정 편의성, 비용 최적화, 관측성, 로컬 모델 지원 여부에 따라 서로 다른 강점을 가지며, 개발 환경과 비즈니스 요구사항에 맞는 전략적 선택이 필요합니다.
Lynkr vs LiteLLM vs OpenRouter vs PortKey: Choosing an LLM Gateway in 2026↗dev.to















