NVIDIA Developer Blog
원문 사이트 ↗NVIDIA Developer Blog의 영문 기사를 한국어 제목·분석과 함께 큐레이션합니다.
NVIDIA Developer Blog 주요 토픽
NVIDIA Developer Blog 관련 글 — 3 페이지
- 0
리더보드에서 얻은 교훈: 5,000명 이상의 Kaggle 참가자들이 AI 추론 개선에 대해 알려준 것들
NVIDIA Nemotron 모델 추론 경진대회는 5,000명 이상의 참가자가 참여하여 AI의 논리적 사고 능력을 개선하는 실전적인 방법론을 제시했습니다. 상위 솔루션들은 단순한 데이터 증설보다 검증 가능한 사고 과정(CoT) 구축, 토큰 예산에 맞춘 추론 압축, 그리고 고품질 학습 데이터 생성을 위한 워크플로우 엔지니어링에 집중했습니다.
Lessons From the Leaderboard: What 5,000+ Kagglers Taught Us About Improving AI Reasoning↗developer.nvidia.com
- 1
RL 에이전트 기술과 NVIDIA NeMo를 활용한 자동 연구 워크플로우 실행 방법
AI 에이전트가 NVIDIA NeMo RL 및 Gym 환경에서 코드 작성, 실험 관리, 논문 구현을 스스로 수행하는 자율적 연구 워크플로우 구축 가능성을 보여줍니다. 특히 GPT 5.현세대급 코딩 에이전트를 통해 시각-언어 모델(VLM)의 특정 태스크 정확도를 25%에서 96.9%로 비약적으로 향상시킨 사례를 제시합니다.
How to Run an Autoresearch Workflow with RL Agent Skills and NVIDIA NeMo↗developer.nvidia.com
- 4
가이드형 생성 모델을 활용한 극한 이벤트 발생 가능성 예측
NVIDIA는 확산 모델 기반의 기후 에뮬레이터를 활용해 태풍 등 극한 이벤트의 발생 가능성을 효율적으로 예측하는 방법론을 제시했습니다. 가이드형 생성 모델로 희귀 사례를 의도적으로 생성하되, 오즈비(odds-ratio) 보정을 통해 편향된 샘플을 실제 확률 분포로 재조정함으로써 기존 몬테카를로 방식보다 훨씬 적은 비용으로 정확한 위험 분석이 가능해집니다.
Extreme Event Likelihoods with Guided Generative Models↗developer.nvidia.com
- 6
JAX 기반 LLM 학습 시 호스트 오프로딩을 통한 고대역폭 메모리 병목 현상 완화
JAX 프레임워크를 활용해 LLM 학습 중 발생하는 HBM 병목을 완화하기 위해, 활성화 데이터를 GPU 대신 호스트 메모리에 저장했다가 필요 시 불러오는 '호스트 오프로딩' 기술이 소개되었습니다. NVIDIA Grace Blackwell의 높은 대역폭을 활용한 이 방식은 재계산(Rematerialization) 대비 훨씬 빠른 학습 속도를 제공하며, 특히 DeepSeek-V3와 같은 거대 MoE 모델에서 탁월한 성능 향상을 보여주었습니다.
Reducing High-Bandwidth Memory Bottlenecks in JAX-Based LLM Training with Host Offloading↗developer.nvidia.com
- 7
NVIDIA CUDA의 커널 퓨전: 메모리 트래픽 및 실행 오버헤드 최적화
본 기사는 GPU 연산의 병목 현상인 메모리 트래픽과 커널 실행 오버헤드를 해결하기 위한 '커널 퓨전(Kernel Fusion)' 기술을 다룹니다. 여러 단계의 연산을 하나의 커널로 통합하여 중간 데이터를 레지스터에 유지함으로써 메모리 대역폭 사용량을 줄이고 성능을 높이는 구체적인 구현 방법을 제시합니다.
Kernel Fusion in NVIDIA CUDA: Optimizing Memory Traffic and Launch Overhead↗developer.nvidia.com
- 9
NVIDIA BioNeMo 에이전트 툴킷으로 엔드투엔드 공동 폴딩 성능 가속화
NVIDIA는 MMseqs2-GPU, cuEquivariance, Fold-CP 등을 통합한 BioNeMO 에이전트 툴킷을 통해 생체 분자 구조 예측 파이프라인의 병목 현상을 해결했습니다. 이를 통해 MSA 생성 속도를 최대 177배 높이고, GPU 메모리 한계를 극복하여 거대 단백질 복합체의 모델링 효율성을 극대화합니다.
Accelerating End-to-End Co-Folding Performance with NVIDIA BioNeMo Agent Toolkit↗developer.nvidia.com
- 10
NVIDIA NeMo를 활용한 금융 AI 연구용 합성 데이터 생성
금융 AI 연구의 한계인 데이터 불균형과 중복 문제를 해결하기 위해 NVIDIA NeMo를 활용한 반복적 합성 데이터 생성 파이프라인을 제안합니다. 이 방식은 생성, 필터링, 글로벌 중복 제거, 가중치 조정을 거쳐 13개 카테고리에 걸친 50만 개 이상의 고유한 금융 뉴스 헤드라인 데이터셋인 FinHeadlineMix를 성공적으로 구축했습니다.
Synthetic Data Generation for Financial AI Research with NVIDIA NeMo↗developer.nvidia.com
- 11
GPU 시작 통신을 활용한 대규모 분자 동력학의 실용적인 가이드
기존 GROMACS 시뮬레이션은 CPU가 GPU 간 데이터 전송을 제어하면서 발생하는 빈번한 동기화로 인해 대규모 확장에 한계가 있었습니다. NVIDIA NVSHMEM을 활용해 GPU가 직접 통신을 주도하도록 설계함으로써, CPU 개입 없이 연산과 통신의 중첩을 극대화하고 성능을 획기적으로 높였습니다.
A Practical Guide to GPU-Initiated Communication for Molecular Dynamics at Scale↗developer.nvidia.com
- 12
NVIDIA GB200 NVL72에서 GPU 가속 Presto로 저지연 분석 워크로드 실행
NVIDIA는 DGX B200 및 GB200 NVL72 환경에서 GPU 가속 Presto를 활용해 TPC-H 벤치마크 기준 CPU 클러스터 대비 최대 8배 낮은 지연 시간을 달성했음을 입증했습니다. cuDF, NVLink, GPUDirect Storage(GDS) 기술을 통해 데이터 전송 병목을 제거하고 대규모 분석 워크로드의 처리 속도를 혁신적으로 높였습니다.
Running Low-Latency Analytical Workloads with GPU-Accelerated Presto on NVIDIA GB200 NVL72↗developer.nvidia.com
- 13
NVIDIA Nemotron 3 Ultra 성능 향상을 위한 LangChain Deep Agents 하니스 프로필 생성
본 기사는 파인튜닝의 높은 비용과 복잡성을 피하기 위해 LangChain의 에이전트 하니스 프로필을 활용하여 모델의 정확도를 개선하는 '하니스 엔지니어링' 기술을 소개합니다. 프롬프트 수정, 미들웨어 추가 등을 통해 오픈 소스 모델의 성능을 최적화하고 자동화된 루프를 통해 지속적으로 개선하는 프로세스를 다룹니다.
Create a LangChain Deep Agents Harness Profile for NVIDIA Nemotron 3 Ultra to Improve Performance↗developer.nvidia.com
- 14
NVIDIA Isaac GR00T로 엔드투엔드 휴머노이드 로봇 정책 개발
엔비디아는 휴머노이드 로봇의 정책 개발을 위해 데이터 수집, 학습, 평가, 배포를 통합한 'Isaac GR00T' 플랫폼을 발표했습니다. 특히 GR00LE 1.7 모델은 대규모 인간 시연 및 시뮬레이션 데이터를 기반으로 한 VLA(Vision-Language-Action) 모델로, 다양한 로봇 형태에 적용 가능한 범용성을 갖추고 있습니다.
Develop Humanoid Robot Policies End-to-End with NVIDIA Isaac GR00T↗developer.nvidia.com
- 15
AI 네이티브 RAN과 NVIDIA AI 에리얼로 분광 효율 극대화
NVIDIA AI Aerial은 GPU의 병렬 연산 능력을 활용해 기존 CPU 기반 RAN이 가진 연산 제약을 해결하고, AI 기반 빔포밍 및 링크 적응 알고리즘을 통해 무선 주파수 효율을 극대화합니다. 이를 통해 Massive MIMO 기술의 이론적 성능과 실제 현장 성능 사이의 간극을 메우고 차세대 5G-Advanced 및 6G 네트워크 구축을 가속화합니다.
Maximize Spectral Efficiency with AI-Native RAN and NVIDIA AI Aerial↗developer.nvidia.com
- 16
NVIDIA Nemotron을 활용한 산업용 경보 관리 분석 AI 에이전트 구축
산업 현장의 과도한 알량 발생 문제를 해결하기 위해 NVIDIA Nemotron 기반의 AI 에이전트 구축 방안을 다룹니다. 이 에이전트는 다양한 데이터 소스에서 컨텍스트를 수집하고 전문적인 분석을 수행하여, 근본 원인 파악부터 조치 권고까지 자동화된 패키지를 제공합니다.
Building an Analysis AI Agent for Industrial Alarm Management with NVIDIA Nemotron↗developer.nvidia.com
- 17
엔비디아 베라 CPU, 에이전트 워크로드 가속을 위해 AI 팩토리 처리량 향상
엔비디아의 Vera CPU는 에이전트 AI와 강화학습(RL) 환경에서 발생하는 CPU 병목 현상을 해결하기 위해 설계되었습니다. Olympus 코어를 통해 코어당 성능을 1.8배 높이고 메모리 대역폭을 3배 이상 확보함으로써, GPU가 더 효율적으로 학습하고 추론할 수 있는 최적화된 AI 인프라를 제공합니다.
NVIDIA Vera CPU Boosts AI Factory Throughput to Accelerate Agentic Workloads↗developer.nvidia.com
- 18
대규모 LLM 학습 시 비균일 텐서 병렬화를 통한 처리량 향상
대규모 LLM 학습 시 GPU의 일시적 중단이나 자원 변동이 발생할 때, 텐서 병렬화(TP) 정도를 동적으로 조정하여 학습 효율을 유지하는 NTP 기술을 소개합니다. 이 방식은 데이터 재분배 오버헤드를 1% 미만으로 줄이고, 남은 GPU의 클럭 주파수를 높이는 전력 부스팅을 결합해 전체적인 학습 성능 저하를 방지합니다.
Enhancing Goodput in Large-Scale LLM Training with Nonuniform Tensor Parallelism↗developer.nvidia.com
- 22
NVIDIA Nsight 개발자 도구를 활용한 신경 재구성 파이프라인 최적화
NVIDIA Omniverse NuRec은 카메라와 라이다 데이터를 활용해 고정밀 3D 환경을 구축하는 기술로, 방대한 데이터 처리 과정에서 발생하는 막대한 연산 비용이 병목 현상으로 지적되어 왔습니다. 개발팀은 Nsight 도구를 통해 CUDA 커널 최적화 및 동기화 제거를 수행하여 GPU 점유율을 최대 50%까지 높이고 주요 커널의 실행 시간을 절반으로 단축했습니다.
Optimizing a Neural Reconstruction Pipeline Using NVIDIA Nsight Developer Tools↗developer.nvidia.com
이 출처 페이지는 글 누적 후 검색엔진에 노출됩니다.







