NVIDIA Developer Blog
원문 사이트 ↗NVIDIA Developer Blog의 영문 기사를 한국어 제목·분석과 함께 큐레이션합니다.
NVIDIA Developer Blog 주요 토픽
NVIDIA Developer Blog 관련 최신 글
- 2
NVIDIA AVO, ARC-AGI-3에서 100% 달성하며 장기 자율 에이전트를 위한 선도적인 범용 아키텍처 입증
NVIDIA의 AVO(Agentic Variation Operators)는 모델의 능력을 넘어 시스템 아키텍처를 통해 장기 자율 작업 수행 능력을 극대화하는 범용 에이전트 구조입니다. 이 기술은 ARC-AGI-3에서 100% 점수를 기록했을 뿐만 아니라, GPU 커널 최적화 과정에서도 기존 FlashAttention-4 대비 최대 10.5% 높은 성능을 달성하며 시스템 설계의 중요성을 입증했습니다.
NVIDIA AVO Reaches 100% on ARC-AGI-3, Demonstrating a Frontier-Level General-Purpose Architecture for Long-Horizon Autonomous Agents↗developer.nvidia.com
- 4
Generative Recommenders가 대규모 RecSys를 재정의하는 방법
기존 임베딩 기반 추천 시스템은 데이터 규모 확대에 따른 메모리 병목과 긴 꼬리(Long-tail) 문제로 한계에 직면해 있으나, 생성형 추천 모델(GR)은 시퀀스 모델링을 통해 이를 해결하고자 합니다. NVIDIA는 HSTU와 같은 혁신적 아키텍처를 효율적으로 구현하고 대규모 임베딩 테이블을 관리할 수 있는 최적화된 솔루션을 제시하며 RecSys의 재정의를 주도하고 있습니다.
How Generative Recommenders Are Redefining RecSys at Scale↗developer.nvidia.com
- 5
NVIDIA Holoscan 애플리케이션 개발: CLI, 스킬즈, 그리고 AI 코딩 에이전트 활용
NVIDIA Holoscan을 활용해 AI 코딩 에이전트가 엔지니어의 가이드에 따라 실시간 내시경 도구 세그멘테이션 앱을 개발하는 과정을 다룹니다. CLI와 문서, 특정 개발 스킬을 에이전트에 통합 제공했을 때 가장 효율적인 개발 워크플로우를 달성할 수 있음을 실험으로 증명했습니다.
Developing NVIDIA Holoscan Applications with CLI, Skills, and AI Coding Agents↗developer.nvidia.com
- 8
NVIDIA SkillEvaluator로 AI 에이전트 기술 성능 평가하기
NVIDIA는 AI 에이전트가 특정 도구와 지침(Skill)을 사용할 때의 성능 변화를 측정하는 오픈소스 평가 프레액워크인 SkillEvaluator를 공개했습니다. 300개 이상의 스킬을 벤치마킹한 결과, 스킬 적용 시 에이전트의 정확도와 효율성이 대폭 향상됨을 확인했으며 이를 통해 에이전트 성능 최적화의 정량적 지표를 제공합니다.
Evaluating AI Agent Skill Performance with NVIDIA SkillEvaluator↗developer.nvidia.com
- 9
AI 코딩 에이전트, NVIDIA ALCHEMI 툴킷으로 재료 시뮬레이션 잠금 해제 방법
NVIDIA ALCHEMI 툴킷은 AI 코딩 에이전트가 자연어를 기반으로 정교한 재료 시뮬레이션 코드를 생성할 수 있도록 API 패턴과 스킬을 제공합니다. 실험 결과, 에이전트는 물리적 정확도를 유지하면서도 GPU 가속 워크플로우를 성공적으로 구축할 수 있음을 입증했습니다.
How AI Coding Agents Can Unlock Materials Simulation with NVIDIA ALCHEMI Toolkit↗developer.nvidia.com
- 10
멀티 GPU를 활용하여 정확도 손실 없이 몇 분 만에 대규모 UMAP 실행하기
NVIDIA cuML과 cuVS 25.06 버전은 멀티 GPU를 활용한 kNN 그래프 구축 기능을 도입하여, 수억 개의 벡터를 포함한 대규모 데이터셋에 대해 정확도 손실 없이 UMAP 실행 속도를 극적으로 높였습니다. 이 기술은 데이터를 클러스터로 분할하여 독립적으로 계산한 뒤 병합하는 방식을 통해 기존 CPU 대비 최대 74배 빠른 성능을 보여줍니다.
Run Massive-Scale UMAP in Minutes Using Multiple GPUs—Without Losing Accuracy↗developer.nvidia.com
- 11
NVIDIA Model Optimizer를 사용한 QAD로 Nemotron 3.5 Lightning NVFP4 개발
NVIDIA는 Model Optimizer를 활용한 QAD(Quantization-Aware Distillation) 파이프라인을 통해 Nemotron 3.5 Lightning 모델의 NVFP4 체크포인트를 개발했습니다. 이 방식은 PTQ보다 공격적인 양자화를 가능하게 하여 모델 크기를 1/3로 줄이고 추론 성능을 최대 4배 향상시켰습니다.
Developing Nemotron 3.5 Lightning NVFP4 with QAD Using NVIDIA Model Optimizer↗developer.nvidia.com
- 12
NVIDIA GB300 NVL72에서 조정 가능한 추론 기능을 갖춘 2.4T 파라미터 모델 Qwen3.8-2.4T-A95B 서비스
알리바바가 공개한 2규모의 오픈 웨이트 모델 Qwen3.8-2.4T-A95B가 엔비디아 블랙웰 기반 GB300 NVL72에서 압도적인 추론 성능을 구현했습니다. 이 모델은 MoE 구조와 하이브리드 어텐션 기술을 통해 최대 100만 토큰의 긴 컨텍스트를 효율적으로 처리하며, 사용자가 작업에 따라 추론 깊이를 조절할 수 있는 기능을 제공합니다.
Serve Qwen3.8-2.4T-A95B, a 2.4T-Parameter Model, with Configurable Reasoning on NVIDIA GB300 NVL72↗developer.nvidia.com
- 14
NVIDIA JetPack 7.2.1, 에이전트 기반 비디오 기능 및 T3000 에뮬레이션 추가
NVIDIA JetPack 7.2.1은 개발자의 의도를 실제 하드웨어 성능으로 연결하는 '에이전트 기반 비디오 스킬'과 Python 환경에서의 고성능 영상 처리를 지원하는 PyNvVideoCodec 2.2를 도입했습니다. 또한, 상위 모델인 Thor에서 T3000 성능을 에뮬레이션할 수 있는 기능을 추가하여 효율적인 AI 비디오 파이프라인 개발을 지원합니다.
NVIDIA JetPack 7.2.1 Adds Agentic Video Skills and T3000 Emulation↗developer.nvidia.com
- 15
NVIDIA 네모트론 3.5 라이트닝, 장시간 실행 에이전트를 위한 빠르고 정확한 전문 작업 수행 제공
NVIDIA는 장시간 실행되는 AI 에이전트의 비용과 지연 시간을 줄이기 위해 최적화된 Nemotron 3.5 Lightning 모델을 공개했습니다. 이 모델은 30B MoE 구조를 통해 높은 정확도를 유지하면서도 기존 유사 규모 모델 대비 최대 4배 빠른 출력 속도를 제공하며, NeMo Switchyard를 통한 지능형 모델 라우팅을 지원합니다.
NVIDIA Nemotron 3.5 Lightning Delivers Fast, Accurate Specialized Task Execution for Long-Running Agents↗developer.nvidia.com
- 16
NVIDIA NeMo Switchyard로 모델에 걸쳐 AI 에이전트 워크로드 라우팅
NVIDIA NeMo Switchyard는 AI 에이전트가 작업의 난이도, 비용, 인프라 상태에 따라 최적의 모델(Frontier vs Specialized)을 선택하도록 돕는 SDK입니다. 이를 통해 개발자는 단일 모델 사용 시 발생하는 높은 비용과 지연 시간을 줄이면서도 필요한 수준의 정확도를 유지할 수 있습니다.
Route AI Agent Workloads Across Models with NVIDIA NeMo Switchyard↗developer.nvidia.com
- 17
Meta의 Muse Glimmer를 활용하여 NVIDIA에서 로컬 에이전트 AI 워크플로우 실행하기
Meta는 120K 이상의 긴 컨텍스트 창을 가진 30B 파라미터 규모의 오픈 웨이트 모델 Muse Glimmer를 출시했습니다. 이 모델은 NVIDIA GPU 환경에서 로컬로 실행되도록 설계되어, 개인정보 보호가 필수적인 복잡한 에이전트 기반 워크플로우를 저비용·고성능으로 처리할 수 있게 합니다.
Run Local Agentic AI Workflows with Meta’s Muse Glimmer on NVIDIA↗developer.nvidia.com
- 18
VLA를 넘어: 월드 액션 모델이 로봇 조작을 어떻게 재편하는가
기존의 시각-언어-행동(VLA) 모델은 사물의 물리적 변화를 예측하는 데 한계가 있었으나, 비디오 월드 모델 기반의 WAM은 역학적 원리를 학습하여 더 강력한 일반화 성능을 제공합니다. NVIDIA의 Cosmos 3는 이러한 WAM 구축을 위한 강력한 파운데이션 모델로서, 적은 데이터로도 새로운 로봇 환경에 빠르게 적응할 수 있는 기술적 토대를 마련했습니다.
Beyond VLAs: How World Action Models Reshape Robot Manipulation↗developer.nvidia.com
- 19
NVIDIA Alpamayo 2 Super로 경로 생성, 추론 기록 및 자동 라벨링 지원
NVIDIA Alpamayo 2 Super는 32B 규모의 추론 모델과 2B 규모의 액션 전문가 모델을 결합한 대규모 VLA 모델로, 자율주행 개발에 필요한 경로 예측, 인과관계 추론, 자동 라벨링 기능을 단일 모델로 제공합니다. 이를 통해 기존에 분절되어 있던 자율주행 개발 프로세스를 통합하여 데이터 큐레이션부터 정책 학습까지 효율적인 워크플로우 구축을 가능하게 합니다.
Generate Trajectories, Reasoning Traces, and Auto-Labels with NVIDIA Alpamayo 2 Super↗developer.nvidia.com
- 20
NVIDIA Vera 스토리지 벤치마크: 더 빠른 암호화, 압축, 무결성 검사 및 복구, AI 네이티브 스토리지용
NVIDIA BlueField-4 STX 스토리지 프로세서는 Armv9.2 기반의 Vera CPU를 통해 암호화, 압축, 무결성 검사 등 스토리지 데이터 경로의 연산 성능을 획기적으로 개선했습니다. 이를 통해 AI 에이전트 워크로드에서 발생하는 막대한 데이터 처리 부하를 낮은 전력과 비용으로 효율적으로 관리할 수 있게 합니다.
NVIDIA Vera Storage Benchmarks: Faster Encryption, Compression, Integrity Checking, and Recovery for AI-Native Storage↗developer.nvidia.com
- 21
공유 GPU 인프라에서 격리된 테넌트 Kubernetes 클러스터 실행 방법
이 글은 한정된 GPU 자원을 여러 팀이 공유하면서도 각 팀의 개발 자율성을 보장하기 위해 KAI Scheduler와 vCluster를 활용하는 방법을 설명합니다. 이를 통해 물리적 하드웨어 분할 없이도 팀별로 독립적인 CRD, RBAC, API 서버를 갖춘 가상 클러스터를 구축하여 인프라 효율성을 극대화할 수 있습니다.
How to Run Isolated Tenant Kubernetes Clusters on Shared GPU Infrastructure↗developer.nvidia.com
- 22
AI 모델 어텐션 공동 설계로 빠른, 상호작용적인 장문맥 추론 구현
에이전트 및 장문맥 워크로드 증가로 인해 어텐션 연산이 전체 추론 시간의 상당 부분을 차지함에 따라, GPU 하드웨어 효율을 극대화하는 모델 아키텍처 공동 설계(Co-design)가 필수적입니다. 본 글은 그룹 크기, 헤드 차원, 병렬화 전략 등 하드웨어 친화적인 설계를 통해 추론 처리량과 응답 속도를 최적화하는 기술적 방법론을 다룹니다.
Co-Designing AI Model Attention for Fast, Interactive Long-Context Inference↗developer.nvidia.com
- 23
NVIDIA 비디오 코덱 SDK 13.1: 제로 카피 트랜스코딩, AV1 B 프레임, 프레임 정확한 시크
NVIDIA Video Codec SDK 13.1은 AV1 계층적 참조 모드를 통해 비트레이트 효율을 높이고, 제로 카피 트랜스코딩으로 GPU 자원 사용량을 최적화했습니다. 또한 프레임 단위의 정밀한 시크 기능과 개선된 디코딩 통계 기능을 제공하여 고성능 영상 분석 및 편집 워크플로우를 지원합니다.
NVIDIA Video Codec SDK 13.1: Zero-Copy Transcode, AV1 B-Frames, and Frame-Accurate Seek↗developer.nvidia.com
이 출처 페이지는 글 누적 후 검색엔진에 노출됩니다.





