AI 모델 (LLM·GPT·Claude·Gemini)
GPT, Claude, Gemini, Llama 등 AI 모델(LLM) 출시·벤치마크·API 변경사항을 모읍니다.
최신 업데이트
AI 모델 관련 글 — 222 페이지
- 6
시레브라스, 1조 파라미터 Kimi K2.6에서 초당 981 토큰 달성, 6.7배 GPU 클라우드 속도 향상 주장
Cerebras의 CS-3 웨이퍼 스케일 칩이 1조 파라미터 규모의 Kimi K2.6 모델에서 초당 981토큰이라는 압도적인 추론 속도를 기록했습니다. 이는 기존 GPU 클라우드 대비 약 6.7배 빠른 수치로, 대규모 모델 추론 시 발생하는 GPU 간 통신 병목 현상을 하드웨어 구조적 혁신으로 해결한 결과입니다.
Cerebras Hits 981 Tokens/sec on 1T-Parameter Kimi K2.6, Claims 6.7 GPU Cloud Speedup↗dev.to
- 8
두 개의 AI 합의 = 하나의 소스: 텅 빈 곳에 구축된 파이프라인을 피하게 해준 규칙
ChatGPT와 Claude가 동일한 평가를 내놓는 '수렴 현상'은 독립적인 검증이 아니라 학습 데이터의 중복으로 인한 상관관계된 오류일 수 있습니다. 저자는 세 차례의 실험을 통해 AI가 도구의 한계나 리소스의 존재 여부에 대해 확신에 찬 허위 정보를 제공함을 증명하며, AI의 모든 기술적 주장을 물리적으로 검증해야 한다는 규칙을 제안합니다.
Deux IA d'accord = une source : la règle qui m'a évité un pipeline bâti sur du vide↗dev.to
- 9
두 개의 AI 리뷰가 동의하는 것은 두 개의 리뷰가 아니다: 채택 전에 주장을 검증하는 법을 배운 이야기
저자는 ChatGPT와 Claude가 동일한 비판과 점수를 내놓은 현상이 독립적 검증이 아닌 학습 데이터의 공유로 인한 '상관관계가 있는 오류'임을 지적합니다. 이를 증명하기 위해 세 가지 사례를 통해 AI의 확신에 찬 주장이 실제 사실과 다름을 입증하며, AI의 주장을 검증 없이 수용하는 것의 위험성을 경고합니다.
Two AI reviews agreeing is not two reviews: how I learned to test claims before adopting them↗dev.to
- 10
RTL 텍스트 환경에서 JSON 정규화가 깨지는 이유 — Real Sigstore 영향 분석
RFC 8785(JCS) 표준이 비-ASCII 문자에 대한 유니코드 정규화(NFC vs NFD) 기준을 정의하지 않아, 시스템 간 JSON 데이터의 바이트 값이 달라지며 디지털 서명이 깨지는 문제가 발생하고 있습니다. 이는 특히 히브리어나 아랍어 등 RTL 언어를 포함한 페이로드에서 에러 메시지 없는 서명 불일치를 유발합니다.
Why JSON Canonicalization Breaks Under RTL Text — Real Sigstore Impact↗dev.to
- 11
데이터로부터 학습이 효과적인 경우는 언제일까 (기초 확률부터 시작하는 수학)
이 글은 데이터로부터의 학습이 언제 신뢰 가능한지를 수학적으로 규명하며, 가설 클래스의 VC 차원이 유한할 때만 학습이 가능하다는 '통계적 학습의 기본 정리'를 설명합니다. 특히 훈련 데이터에서의 오차(Empirical Risk)가 실제 데이터에서의 오차(True Risk)를 대변할 수 있는 조건을 PAC 학습 프레임워크를 통해 분석합니다.
When does learning from data work (math starting from basic probability)↗prateekchandrajha.github.io
- 13
MCP가 컨텍스트 윈도우를 잠식하고 있다 (그리고 무엇을 해야 할까)
MCP 서버를 통해 연결된 수많은 도구의 JSON 스키마가 매 API 호출마다 전체 주입되면서, 실제 대화 내용보다 도구 설명에 더 많은 토큰이 소모되는 현상이 발생하고 있습니다. 이는 컨텍스트 윈도우의 급격한 감소와 운영 비용의 폭증을 초래하며, 이를 해결하기 위해 필요한 도구만 검색해서 사용하는 'ToolSearch' 방식의 도입이 요구됩니다.
MCPs Are Eating Your Context Window (And What To Do About It)↗dev.to
- 15
$12/월 DigitalOcean GPU Droplet에서 vLLM + Sparse Routing으로 Mixtral 8x7B 배포하는 방법: Claude 비용의 1/85 수준의 전문가 Mixture-of-Experts
이 기사는 vLLM의 Sparse Routing 최적화 기술을 활용하여 월 12달러 수준의 저렴한 GPU 인프라에서 Mixtral 8x7B 모델을 효율적으로 배포하는 구체적인 가이드를 제공합니다. 이를 통해 Claude와 같은 고가 API 대비 토큰당 비용을 획기적으로 낮추는 기술적 방법론과 경제적 이점을 설명합니다.
How to Deploy Mixtral 8x7B with vLLM + Sparse Routing on a $12/Month DigitalOcean GPU Droplet: Expert Mixture-of-Experts at 1/85th Claude Cost↗dev.to
- 16
DigitalOcean에서 Llama 2를 월 5달러로 배포하는 방법: 완벽 자가 호스팅 가이드
이 글은 DigitalOcean의 Droplet을 활용하여 Llama 2 모델을 월 24달러 수준의 고정 비용으로 배포하는 구체적인 방법을 다룹니다. API 기반의 종량제 모델에서 벗어나, 자체 인프라 구축을 통해 비용 효율성, 데이터 프라이버시, 그리고 서비스 안정성을 동시에 확보하는 전략을 제안합니다.
How to Deploy Llama 2 on DigitalOcean for $5/Month: Complete Self-Hosting Guide↗dev.to
- 18
클로드(Claude)가 제 분석 데이터를 직접 쿼리할 수 있도록 MCP 서버 구축. 예상치 못한 활용 사례
분석 SaaS 개발자가 MCP 서버를 구축하여 Claude가 매출 및 트래픽 데이터를 직접 쿼리할 수 있게 한 사례를 소개합니다. 이를 통해 사용자는 대시보드를 직접 탐색하는 대신 자연어로 질문하여 인사이트를 얻고, 별도의 코딩 없이 슬랙 봇을 만드는 등 예상치 못한 자동화 혁신을 경험하고 있습니다.
Built an MCP server so Claude can query my analytics directly. Use cases I did not expect↗indiehackers.com














