AI 모델 (LLM·GPT·Claude·Gemini)
GPT, Claude, Gemini, Llama 등 AI 모델(LLM) 출시·벤치마크·API 변경사항을 모읍니다.
최신 업데이트
AI 모델 관련 글 — 230 페이지
- 3
LP, FUSE, C/R, CUDA-checkpoint으로 추론 초기 지연 40배 단축
AI 추론 수요의 급격한 변동성에 대응하기 위해 기존 수십 분 이상 소요되던 GPU 인스턴스 생성 시간을 수십 초 단위로 단축하는 기술적 성과를 다룹니다. 이를 위해 클라우드 버퍼, 지연 로딩 파일시스템, CPU 및 GPU 측면의 체크포인트/복구 기술을 결합하여 GPU 할당 효율성을 극대화하는 방법을 제시합니다.
Cutting inference cold starts by 40x with LP, FUSE, C/R, and CUDA-checkpoint↗modal.com
- 7
추론 중재: 하루 200건 이상의 LLM 호출을 5가지 모델에 분산하는 방법
이 글은 모든 AI 작업을 고가의 모델에 의존하는 대신, 작업 유형에 따라 Claude Sonnet, Opus, Gemini Flash, Qwen 등 다양한 모델을 전략적으로 배치하는 '추론 중재' 방식을 제안합니다. 이를 통해 비용을 절감하면서도 보안과 성능이라는 두 마기 토끼를 잡는 구체적인 모델 스택과 라우팅 규칙을 제시합니다.
Inference Arbitrage: How I Route 200+ Daily LLM Calls Across Five Models↗dev.to
- 8
Anthropic API 속도 제한에 맞서 싸우다 그만두고, 하나의 모델이 모든 일을 할 필요는 없다는 것을 깨달았을 때
Anthropic API의 다각적인 속도 제한(RPM, ITPM, OTPM 등)과 예측 불가능한 지연 시간은 에이전트 기반 시스템의 안정성을 위협하는 주요 요인입니다. 이를 극복하기 위해서는 모든 요청을 하나의 모델에 맡기는 대신, 작업의 중요도와 성격에 따라 최적의 모델과 경로를 할당하는 전략적 라우팅 설계가 필요합니다.
I stopped fighting the Anthropic API rate limit when I realized one model shouldn’t do every job↗dev.to
- 18
RAG 시리즈 (19): 점진적 업데이트 - 지식 기반을 최신 상태로 유지하기
데이터가 지속적으로 변하는 실제 운영 환경에서 RAG 인덱스를 효율적으로 관리하는 점진적 업데이트(Incremental Update) 방법을 다룹니다. LangChain의 Indexing API를 활용해 해시 값을 비교함으로써, 변경된 문서만 임베팅하고 삭제된 문서를 정리하여 비용과 시간을 최적화하는 구체적인 구현 방안을 제시합니다.
RAG Series (19): Incremental Updates — Keeping the Knowledge Base Fresh↗dev.to
- 22
$5/월 DigitalOcean Droplet에서 Ollama + MinIO Object Storage로 Llama 3.2 배포하는 방법: 분산 추론과 지속적인 모델 캐싱
이 글은 고가의 Claude나 GPT API 대신 월 5달러 규모의 저렴한 클라우드 인프라를 활용해 Llama 3.2를 직접 호스팅하는 구체적인 가이드를 제공합니다. MinIO를 활용한 모델 캐싱과 Docker 기반의 배점 방식을 통해 비용 효율적이면서도 확장 가능한 자체 추론 엔진 구축 전략을 다룹니다.
How to Deploy Llama 3.2 with Ollama + MinIO Object Storage on a $5/Month DigitalOcean Droplet: Distributed Inference with Persistent Model Caching↗dev.to
- 23
$5/월 DigitalOcean Droplet에서 Ollama + PostgreSQL 벡터 캐싱으로 Llama 3.2 배포하는 방법: 프로덕션 RAG을 위한 80% 저렴한 의미 검색
OpenAI와 Pinecone 등 외부 API에 의존하는 기존 RAG 방식의 높은 비용 문제를 해결하기 위해, 저렴한 VPS에 LMS와 pgvector를 구축하는 방법을 제시합니다. 벡터 캐싱을 통해 중복된 임베딩 연산을 제거함으로써 검색 비용을 획기적으로 낮추고 운영 효율성을 극대화하는 것이 핵심입니다.
How to Deploy Llama 3.2 with Ollama + PostgreSQL Vector Caching on a $5/Month DigitalOcean Droplet: 80% Cheaper Semantic Search for Production RAG↗dev.to

















