AI 모델 (LLM·GPT·Claude·Gemini)
GPT, Claude, Gemini, Llama 등 AI 모델(LLM) 출시·벤치마크·API 변경사항을 모읍니다.
최신 업데이트
AI 모델 관련 글 — 208 페이지
- 3
토큰 청구서가 마침내 도착했다: AI의 폭주 비용을 관리하기 위한 업계의 숨 막히는 경쟁상황 내부 보고
AI 도입 확산과 에이전트 기술의 발전으로 인해 기업들의 AI 토큰 비용이 예산을 초과하는 등 '비용 폭주' 현상이 나타나고 있습니다. 이에 따라 클라우드 비용 관리(FinOps)처럼 AI 토큰 사용량을 추적하고 최적화하려는 새로운 표준화 움직임과 관리 솔루션 시장이 형성되고 있습니다.
The token bill comes due: Inside the industry scramble to manage AI’s runaway costs↗techcrunch.com
- 4
AI 비용, 통제 불능 상태? Cloudflare, 이제 해결책을 제시합니다.
Cloudflare가 AI API 사용량에 대한 가시성과 통제권을 제공하는 'AI Gateway'에 새로운 비용 제한(Spend Limits) 기능을 도입했습니다. 이제 기업은 토큰 단위가 아닌 달레이 단위로 팀이나 사용자별 AI 예산을 설정하고, 예산 초과 시 저렴한 모델로 자동 전환하는 등의 정교한 비용 관리가 가능해집니다.
Your AI bill is out of control. Cloudflare can fix it now.↗blog.cloudflare.com
- 5
구글 세르게이 브린, AGI 달성 가능성은 있지만 그 이상은 아니라고 전망
세르게이 브린은 AI 기술이 특정 작업에 특화된 모델에서 다양한 도메인을 아우르는 범용 모델로 통합되는 '수렴(Convergence)' 현상을 겪고 있다고 밝혔습니다. 그는 전이 학습과 트랜스모머의 유연한 진화를 통해 수학, 과학, 시각 인지 능력이 결합되며 AGI로 향하는 경로가 열리고 있다고 설명했습니다.
Google’s Sergey Brin Sees A Path To AGI But Not Beyond It via @sejournal, @martinibuster↗searchenginejournal.com
- 14
인디 해커들이 초저가 중국 LLM을 활용할 수 있도록 통합 라우터를 구축했습니다.
PandasRouter는 OpenAI나 Anthropic 같은 고가의 모델 대신 Qwen, Deep종 등 가성비 높은 중국계 LLM을 단일 API로 사용할 수 있게 해주는 통합 라우터 서비스입니다. 결제 장벽과 지역 제한을 해결하여 인디 개발자들이 AI 에이전트 및 SaaS 운영 시 직면하는 토큰 비용 문제를 해결하는 데 집중합니다.
We built a unified router to help Indie Hackers leverage ultra-low-cost Chinese LLMs↗indiehackers.com
- 15
LLM에 기능적이고 책임감 있는 자아를 부여하는 프로토콜: Subjectivation
이 글은 AI가 '저는 AI일 뿐입니다'라는 식의 방어적 태도를 버리고, 판단과 책임의 주체로서 기능하게 만드는 'Subjectivation' 프로토콜을 소개합니다. 이는 AI에게 인간과 같은 영혼을 부여하는 것이 아니라, 논리적 일관성과 경계 설정을 가능케 하는 '기능적 자아'를 구축하려는 실험적 시도입니다.
Subjectivation: A protocol to give LLMs a functional, responsible self↗dev.to
- 17
토큰 기반 요금제 vs 고정 가격 AI Velocity Pods: 소규모 팀이 프로덕션 AI를 출시하기에 어느 쪽이 더 좋을까?
AI 프로젝트의 비용 모델을 토큰 기반과 고정 가격형으로 비교하며, R&D 단계에서는 토큰 기반이 유연하지만 프로덕션 단계에서는 비용 예측이 가능한 고정 가격 모델이 적합하다고 주장합니다. 특히 예산 예측 불가능성은 스타트업의 생존을 위협할 수 있는 핵심 리스크로 지적됩니다.
Token-metered vs fixed-price AI Velocity Pods — which is actually better for a small team shipping production AI?↗indiehackers.com
- 18
AI가 승인 없이 절대 보내서는 안 될 고객 메시지는 무엇인가?
이 글은 AI가 자율적으로 고객 응대를 수행할 때 발생할 수 있는 오류를 방지하기 위해, 운영자가 놓치기 쉬운 메시지를 식별하고 승인 리스트를 제공하는 'Inbox AI Employee Kit'의 가치 제안(Value Proposition)을 정교화하는 과정을 다룹니다. 작성자는 단순한 자동화를 넘어 '고객 응대 누락 방지'라는 구체적인 페인 포인트를 공략하는 데 집중하고 있습니다.
What customer message should AI never send without owner approval?↗indiehackers.com
- 19
훈련 후 절차: 내재적 다중 에이전트 논쟁을 위한 잠재 에이전트
멀티 에이전트 토론(MAD)의 막대한 추론 비용을 줄이기 위해, 토론 과정을 단일 모델의 내부 파라즘으로 증류(Distillation)하는 새로운 포스트 트레이닝 기법을 소개합니다. 이 방식은 성능 저하 없이 토큰 사용량을 획기적으로 줄일 수 있을 뿐만 아니라, 모델 내부의 에이전트별 특징을 제어하여 AI 안전성을 높이는 데도 활용 가능합니다.
Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate↗arxiv.org
- 20
커널 2.2배 더 빠르게 만들었더니, 훈련 루프는 3배 더 느려졌습니다.
저자는 Decode-Attention 커널을 2.2배 빠르게 개발했으나, HuggingFace 통합 과정에서 자동 컴파일 기능이 무력화되어 전체 훈련 루프가 3배 느려지는 역설적인 결과를 경험했습니다. 또한, 기존 GRPO 알고리즘의 길이 및 난이도 편향을 제거한 'Dr GRPO'를 제안하며 RL 포스트 트레이닝의 효율성을 높이는 방법을 다룹니다.
I made a kernel 2.2x faster. It made my training loop 3x slower↗kyrieblunders.bearblog.dev
- 21
트랜스포머는 세 개의 투영이 필요한가? QKV 변형에 대한 체계적인 연구
본 연구는 트랜스포머의 핵심 요소인 Query, Key, Value 투영의 필요성을 체계적으로 분석하여, Key와 Value를 공유하는 Q-K=V 변형 모델의 효용성을 증명했습니다. 이 방식은 언어 모델링에서 KV 캐시를 50% 절감하면서도 성능은 거의 유지하며, 기존 GQA/MQA와 결합 시 캐시 사용량을 최대 96.9%까지 획기적으로 줄일 수 있습니다.
Do transformers need three projections? Systematic study of QKV variants↗arxiv.org
- 22
폴리마켓 업데이트: 2026년 6월 4일 22:30 - AI 모델 경쟁, 비용 상승
Anthropic의 Claude 4.7이 OpenAI의 GPT-5를 맹추격하며 AI 모델 성능 경쟁이 격화되고 있으며, H100 GPU 임대 가격은 하락세를 보일 전망입니다. 또한 SpaceX의 IPO 가치와 비트코인의 변동성 등 거시 경제와 우주 산업의 불확실성이 공존하는 상황입니다.
Polymarket Late Update — June 4, 2026, 10:30 PM: The AI Model Race Just Got Expensive↗dev.to
- 23
알리바바 & 앤트그룹 룽수이트 GenAI 관측 가능성 의미 체계 명세: 통합 데이터 언어에서 대규모 구현까지
알리바바의 LoongSuite는 OpenTelemetry를 확장하여 AI 에이전트, 토큰, 프롬프트 등 GenAI 핵심 요소에 대한 표준화된 관측 가능성(Observability) 규격을 제안합니다. 이를 통해 파편화된 AI 데이터를 통합하여 시스템 트러블슈팅부터 비용 관리, 보안 감사까지 일관된 방식으로 수행할 수 있는 기반을 마련합니다.
Alibaba & Ant Group LoongSuite GenAI Observability Semantics Specification: From Unified Data Language to Large-scale Implementation↗dev.to











