AI 모델 (LLM·GPT·Claude·Gemini)
GPT, Claude, Gemini, Llama 등 AI 모델(LLM) 출시·벤치마크·API 변경사항을 모읍니다.
최신 업데이트
AI 모델 관련 글 — 60 페이지
- 2
NVIDIA Vera 스토리지 벤치마크: 더 빠른 암호화, 압축, 무결성 검사 및 복구, AI 네이티브 스토리지용
NVIDIA BlueField-4 STX 스토리지 프로세서는 Armv9.2 기반의 Vera CPU를 통해 암호화, 압축, 무결성 검사 등 스토리지 데이터 경로의 연산 성능을 획기적으로 개선했습니다. 이를 통해 AI 에이전트 워크로드에서 발생하는 막대한 데이터 처리 부하를 낮은 전력과 비용으로 효율적으로 관리할 수 있게 합니다.
NVIDIA Vera Storage Benchmarks: Faster Encryption, Compression, Integrity Checking, and Recovery for AI-Native Storage↗developer.nvidia.com
- 3
Qwen3.8-Max, 에이전트 컴퓨터 사용 성능에서 GPT-5.6 Sol Max 및 Fable 5를 능가한다는 야심찬 주장을 내세워 출시
알리바바의 Qwen AI 연구팀이 2.4조 파라미터 규모의 MoE 멀티모달 LLM인 Qwen3.8-Max를 발표했습니다. 이 모델은 자율 소프트웨어 엔지니어링과 기업용 장기 업무 자동화를 목표로 하며, 에이전트 성능 면에서 기존 강자들을 능가할 것으로 기대됩니다.
Qwen3.8-Max arrives with a bold claim: it outperforms GPT-5.6 Sol Max and Fable 5 on agentic computer use↗venturebeat.com
- 5
인퍼런스 엔지니어링 마스터클래스 — 필립 키얼리 & 알리 타하, 베이스타임
Baseten이 주도하는 인퍼런스 엔지니어링은 학습된 가중치를 빠르고 저렴하며 확장 가능한 제품으로 전환하는 전문적인 공학 분야입니다. 양자화 오차 상쇄, 분리된 프리필/디코딩(disaggregated prefill/decode), 캐시 인식 라우팅 등 고도화된 최적화 기술을 통해 모델의 추론 성능을 최대 200%까지 향상시키는 것이 핵심입니다.
The Inference Engineering Masterclass — Philip Kiely & Ali Taha, Baseten↗latent.space
- 11
Show HN: Codex 기술이 토큰을 절약하는가? 여섯 번 실행한 작업 크기 벤치마크
LLM을 활용한 코드 생성 작업에서 다양한 엔지니어링 루프 접근 방식에 따른 토큰 소모량과 실행 시간을 비교 분석했습니다. 실험 결과, 'Lean' 방식이 가장 적은 토큰을 사용하면서도 가장 빠른 속도로 작업을 성공시켰음을 보여줍니다.
Show HN: Do Codex skills save tokens? A six-run task-size benchmark↗codex-howto-benchmark.nguyenvantamdk2.chatgpt.site
- 13
온디바이스 LLM을 위한 양자화 인식 파인튜닝: Android 및 iOS에서 FP16 정확도에 맞는 INT4 모델 구축
본 기사는 모바일 환경을 위한 LLM 양자화 시 PTQ 대신 QAT를 사용하여 정확도 손실을 방지하는 전략을 다룹니다. 적절한 보정 데이터셋 구축과 GGUF 포맷 선택, 그리고 자동화된 성능 회귀 테스트 파이프라인 구축의 중요성을 강조합니다.
Quantization-Aware Fine-Tuning for On-Device LLMs: Building INT4 Models That Match FP16 Accuracy on Android and iOS↗dev.to



![[기자수첩] KAIST AI 해커가 남긴 숙제](https://startupschool.cc/og/기자수첩-kaist-ai-해커가-남긴-숙제-9187d5.jpg)














