AI 모델 (LLM·GPT·Claude·Gemini)
GPT, Claude, Gemini, Llama 등 AI 모델(LLM) 출시·벤치마크·API 변경사항을 모읍니다.
최신 업데이트
AI 모델 관련 글 — 131 페이지
- 1
오픈 웨이트 LLM API 통합: 오픈 모델을 위한 드롭인 API 지원 시작하기
이 기사는 GPU 서버 구축이나 복잡한 인프라 관리 없이 오픈 웨이트 LLM을 API 형태로 사용하는 효율적인 통합 방법을 설명합니다. NovaAPI와 같은 드롭인(drop-in) 방식의 서비스를 활용하면 기존 코드 변경을 최소화하면서도 다양한 모델을 유연하게 교체하며 운영할 수 있습니다.
Open-Weight LLM API Integration: Getting Started with Drop-in API Support for Open Models↗dev.to - 2
순수 파이썬과 NumPy로 LLM 시스템 구축하기: 아키텍처, 불변성, 그리고 깔끔한 코드
Draco AI는 외부 라이브러리 의존성을 완전히 제거하고 NumPy 기반의 독자적인 연산 경로를 구축하여 메모리 사용량을 획기적으로 줄인 LLM 시스템입니다. Ternary Quantization과 계층적 캐싱, 그리고 자가 치유 파이프라인을 통해 추론 효율성과 생성 품질을 동시에 극대화하는 것을 목표로 합니다.
Building an LLM System from Scratch in Pure Python & NumPy: Architecture, Invariants, and Clean Code↗dev.to
- 7
RAG 로컬 환경 .NET: 문서와 대화하기 (클라우드, API 키 불필요)
이 기사는 외부 API 호출 없이 로컬 환경에서 작동하는 .NET 기반의 RAG(Retrieval-Augmented Generation) 시스템 구축 과정을 다룹니다. Ollama와 SQLite를 활용해 문서 데이터를 벡터화하고, 이를 통해 모델의 환각 현상을 방지하며 보안이 강화된 지식 베이스를 만드는 방법을 설명합니다.
RAG local en .NET: Chatea con tu Documentación (sin nube, sin API keys)↗dev.to
- 10
AI 테스트는 단일 문제가 아니다: 셀렉터, 검색 품질, 스트리밍 상태, 그리고 인간 검토
AI 테스트는 자동화된 테스트를 관리하는 '도구로서의 AI'와 AI 기반 제품 기능을 검증하는 '대상으로서의 AI'로 나뉩니다. 전자는 셀렉터 복구를 통한 효율성을 추구하되 버그 은폐 위험을 관리해야 하며, 후자는 결과의 품질과 관련성을 평가하기 위한 별도의 데이터셋과 인간의 검토가 병행되어야 합니다.
AI Testing Is Not One Problem: Selectors, Search Quality, Streaming State, and Human Review↗dev.to
- 11
2026년 LLM 친화적인 콘텐츠 구조를 위해 You.com 활용법
이 기사는 Perplexity나 ChatGPT Search와 같은 AI 검색 엔진에 최적화된 'LLM 친화적 콘텐츠 구조'를 만드는 방법을 다룹니다. You.com의 멀티 모델 비교 기능을 활용해 다양한 LLM이 내 콘텐츠를 어떻게 해석하고 인용하는지 테스트하며, 엔티티 태깅과 스키마 마크업을 통해 인용 가능성을 극대화하는 워크플로우를 제시합니다.
How to Use You.com for Llm-Friendly Content Structure in 2026↗dev.to
- 17
JAX 기반 LLM 학습 시 호스트 오프로딩을 통한 고대역폭 메모리 병목 현상 완화
JAX 프레임워크를 활용해 LLM 학습 중 발생하는 HBM 병목을 완화하기 위해, 활성화 데이터를 GPU 대신 호스트 메모리에 저장했다가 필요 시 불러오는 '호스트 오프로딩' 기술이 소개되었습니다. NVIDIA Grace Blackwell의 높은 대역폭을 활용한 이 방식은 재계산(Rematerialization) 대비 훨씬 빠른 학습 속도를 제공하며, 특히 DeepSeek-V3와 같은 거대 MoE 모델에서 탁월한 성능 향상을 보여주었습니다.
Reducing High-Bandwidth Memory Bottlenecks in JAX-Based LLM Training with Host Offloading↗developer.nvidia.com
- 20
Amazon SageMaker AI 서버리스 모델 커스터마이징으로 NVIDIA Nemotron 3 모델 미세 조정하기
Amazon SageMaker AI가 NVIDIA Nemotron 3 Nano 및 Super 모델에 대해 인프라 관리 없이 미세 조정이 가능한 서버리스 커스터마이징 기능을 도입했습니다. Mamba-Transformer MoE 아키텍처를 기반으로 한 이 모델들은 높은 처리량과 효율성을 제공하며, 기업은 SFT, RLVR 등의 기술을 통해 자사 데이터에 최적화된 독자적인 AI 자산을 구축할 수 있습니다.
Fine-tune NVIDIA Nemotron 3 models with Amazon SageMaker AI serverless model customization↗aws.amazon.com
- 22
KTern.AI가 Amazon Bedrock AgentCore 기반의 에이전트형 AI를 SAP에 구축한 방법
SAP 디지털 전환 전문 기업 KTern.AI는 Amazon Bedrock AgentCore와 Strands Agents SDK를 도입하여 복잡한 SAP 워크플로우를 자율적으로 관리하는 에이전트형 AI 플랫폼을 구축했습니다. 이를 통해 인프라 운영 부담을 줄이고, 도메인 지식에 집중하며 새로운 AI 에이전트를 단 몇 시간 만에 배포할 수 있는 환경을 마련했습니다.
How KTern.AI built agentic AI for SAP on Amazon Bedrock AgentCore↗aws.amazon.com
- 23
SageMaker HyperPod에서 LLM 추론을 위한 분산 프리필 및 디코딩
Amazon SageMaker HyperPod는 LLM 추론의 두 단계인 프리필과 디코딩을 별도의 GPU 풀로 분리하는 DPD(Disaggregated Prefill and Decode) 기술을 제공합니다. 이를 통해 긴 프롬프트가 기존 요청의 토큰 생성 속도를 늦추는 간섭 현상을 제거하고, 대규모 동시 접속 환경에서도 일관된 응답 성능을 보장합니다.
Disaggregated prefill and decode for LLM inference on SageMaker HyperPod↗aws.amazon.com



![[7월10일] GPT-5.6이 보여준 '파레토 프론티어' 경쟁...벤치마크 기준이 바뀌기 시작](https://startupschool.cc/og/7월10일-gpt-56이-보여준-파레토-프론티어-경쟁벤치마크-기준이-바뀌기-시작-8d9cc4.jpg)










