AI 모델 (LLM·GPT·Claude·Gemini)
GPT, Claude, Gemini, Llama 등 AI 모델(LLM) 출시·벤치마크·API 변경사항을 모읍니다.
최신 업데이트
AI 모델 관련 글 — 67 페이지
- 6
RunPod 서버리스: MODEL_ID 변경 후 작업이 영구적으로 대기열에 갇힘
RunPod 서버리스 사용 중 모델 ID를 변경했을 때 작업이 'IN_QUEUE' 상태에서 멈추는 현상은 환경 변수와 코드 내 고정된 리비전 값이 서로 일치하지 않아 발생하는 문제입니다. 이는 워커가 실행 단계에서 가중치를 로드하지 못해 즉시 종료되면서 발생하는 문제로, 모델 ID와 리비전을 하나의 단위로 관리하는 것이 핵심입니다.
RunPod serverless: jobs stuck in queue forever after changing MODEL_ID↗dev.to
- 11
스테이트리스 MCP가 다시 제 관심을 사로잡았습니다 (그리고 mcp-explorer와 datasette-mcp에 영감을 주었습니다)
MCP 2.0 스펙 도입으로 기존의 복잡한 세션 기반 통신 방식이 단일 HTTP 요청을 사용하는 스테이트리스 방식으로 전환되었습니다. 이를 통해 개발자는 서버 측 상태 유지 부담 없이 더 쉽고 안전하게 LLM 에이전트용 도구를 구현하고 확장할 수 있게 되었습니다.
Stateless MCP has recaptured my interest (and inspired mcp-explorer and datasette-mcp)↗simonwillison.net
- 14
AI 모델 어텐션 공동 설계로 빠른, 상호작용적인 장문맥 추론 구현
에이전트 및 장문맥 워크로드 증가로 인해 어텐션 연산이 전체 추론 시간의 상당 부분을 차지함에 따라, GPU 하드웨어 효율을 극대화하는 모델 아키텍처 공동 설계(Co-design)가 필수적입니다. 본 글은 그룹 크기, 헤드 차원, 병렬화 전략 등 하드웨어 친화적인 설계를 통해 추론 처리량과 응답 속도를 최적화하는 기술적 방법론을 다룹니다.
Co-Designing AI Model Attention for Fast, Interactive Long-Context Inference↗developer.nvidia.com
- 17
smevals - 모델, 프롬프트, 그리고 하네스를 평가하기 위한 소규모 평가 도구 모음
Simon Willison이 발표한 smevals는 모델, 프롬프트, 하네스의 성능을 실험하고 결과물을 정량적으로 평가할 수 있는 소규모 에발(eval) 스위트입니다. 사용자는 YAML 설정을 통해 다양한 모델 구성을 테스트하고, 체크리스트 기반의 그레이더를 통해 실행 결과를 검증하며, 시각화된 리포트를 생성할 수 있습니다.
smevals - a small eval suite for evaluating models, prompts, and harnesses↗simonwillison.net
- 20
Gemini Enterprise Agent 플랫폼의 에이전트 및 모델 평가는 이제 GA
Gemini Enterprise Agent 플랫폼의 에이전트 및 모델 평가 기능이 GA를 통해 정식 서비스됩니다. 이 기능은 2상 이상의 사전 구축된 지표와 맞춤형 적응형 루브릭(Adaptive Rubrics)을 제공하며, 개발 중 실험부터 실제 운영 트래픽에 대한 실시간 모니터링까지 통합된 평가 프로세스를 지원합니다.
Agent and Model Evaluations in Gemini Enterprise Agent Platform are now GA↗developers.googleblog.com











![[유미's 픽] 구글 AI 에이전트 '제미나이 스파크', 韓서 통할까](https://startupschool.cc/og/유미s-픽-구글-ai-에이전트-제미나이-스파크-韓서-통할까-95967d.jpg)
![[7월31일] 오픈AI, GPT-5.6 가격 인하의 비결은 '컴퓨트 멀티플라이어'](https://startupschool.cc/og/7월31일-오픈ai-gpt-56-가격-인하의-비결은-컴퓨트-멀티플라이어-f0a6ad.jpg)





