NVIDIA 뉴스
AI 반도체 시장을 주도하는 NVIDIA의 GPU, CUDA, 데이터센터 소식을 전합니다.
총 670건·최신 업데이트
- 423
NVIDIA CUDA의 커널 퓨전: 메모리 트래픽 및 실행 오버헤드 최적화
본 기사는 GPU 연산의 병목 현상인 메모리 트래픽과 커널 실행 오버헤드를 해결하기 위한 '커널 퓨전(Kernel Fusion)' 기술을 다룹니다. 여러 단계의 연산을 하나의 커널로 통합하여 중간 데이터를 레지스터에 유지함으로써 메모리 대역폭 사용량을 줄이고 성능을 높이는 구체적인 구현 방법을 제시합니다.
Kernel Fusion in NVIDIA CUDA: Optimizing Memory Traffic and Launch Overhead↗developer.nvidia.com
- 424
Amazon SageMaker AI 서버리스 모델 커스터마이징으로 NVIDIA Nemotron 3 모델 미세 조정하기
Amazon SageMaker AI가 NVIDIA Nemotron 3 Nano 및 Super 모델에 대해 인프라 관리 없이 미세 조정이 가능한 서버리스 커스터마이징 기능을 도입했습니다. Mamba-Transformer MoE 아키텍처를 기반으로 한 이 모델들은 높은 처리량과 효율성을 제공하며, 기업은 SFT, RLVR 등의 기술을 통해 자사 데이터에 최적화된 독자적인 AI 자산을 구축할 수 있습니다.
Fine-tune NVIDIA Nemotron 3 models with Amazon SageMaker AI serverless model customization↗aws.amazon.com
- 425
NVIDIA BioNeMo 에이전트 툴킷으로 엔드투엔드 공동 폴딩 성능 가속화
NVIDIA는 MMseqs2-GPU, cuEquivariance, Fold-CP 등을 통합한 BioNeMO 에이전트 툴킷을 통해 생체 분자 구조 예측 파이프라인의 병목 현상을 해결했습니다. 이를 통해 MSA 생성 속도를 최대 177배 높이고, GPU 메모리 한계를 극복하여 거대 단백질 복합체의 모델링 효율성을 극대화합니다.
Accelerating End-to-End Co-Folding Performance with NVIDIA BioNeMo Agent Toolkit↗developer.nvidia.com
- 429
NVIDIA NeMo를 활용한 금융 AI 연구용 합성 데이터 생성
금융 AI 연구의 한계인 데이터 불균형과 중복 문제를 해결하기 위해 NVIDIA NeMo를 활용한 반복적 합성 데이터 생성 파이프라인을 제안합니다. 이 방식은 생성, 필터링, 글로벌 중복 제거, 가중치 조정을 거쳐 13개 카테고리에 걸친 50만 개 이상의 고유한 금융 뉴스 헤드라인 데이터셋인 FinHeadlineMix를 성공적으로 구축했습니다.
Synthetic Data Generation for Financial AI Research with NVIDIA NeMo↗developer.nvidia.com
- 430
파리 기반 AI 음성 스타트업 그라디움, 엔비디아의 투자를 받아 시드 투자 1억 달러 확보
파리의 AI 음성 스타트업 그라디움(Gradium)이 엔비디아를 포함한 투자자들로부터 총 1억 달러 규모의 시드 투자를 유치했습니다. 이들은 초저지연 오디오 기술을 통해 실시간 대화가 가능한 AI 모델을 개발 중이며, 확보된 자금으로 미국 베이 에어리어에 사무실을 열고 글로벌 인재 영입 및 시장 확대를 추진할 계획입니다.
Paris-based AI voice startup Gradium raises $100M seed, backed by Nvidia↗techcrunch.com
- 435
인텔 2,000달러짜리 GPU, 엔비디아의 8,000달러짜리 플래그십 모델 압도
인텔 Arc Pro B70 쿼드 구성이 엔비디아 RTX 5090D 대비 압도적인 추론 성능을 보여주며 하드웨어 비용 최적화의 새로운 가능성을 열었습니다. 동시에 스스로 판단하는 에이전틱 AI를 활용한 지능형 랜섬웨어 공격과 유럽의 규제 강화로 인한 LLM 도입 지연 등 보안 및 규제 측면의 새로운 위협이 가시화되고 있습니다.
Intel's $2,000 GPU Just Punched Way Above Its Weight Class Against NVIDIA's $8,000 Flagship↗dev.to
- 439
삼성노바, 최신 벤치마크에서 노후화된 엔비디아 GPU에 새로운 활력 불어넣다 (AI 칩 스타트업, 인텔 지원)
삼바노바는 엔비디아 H200과 자사의 SN50 RDU를 결합하여 MiniMax M2.7 모델에서 초당 763토큰이라는 압도적인 추론 속도를 기록했습니다. 이번 성과는 연산 집약적인 프리필(prefill) 단계와 메모리 대역폭 중심의 디코드(decode) 단계를 분리하는 이기종 컴퓨팅 전략을 통해 기존 GPU 인프라의 효율성을 극대화할 수 있음을 보여줍니다.
Intel-backed AI chip startup SambaNova breathes new life into aging Nvidia GPUs in latest benchmarks↗theregister.com
- 440
NVIDIA GB200 NVL72에서 GPU 가속 Presto로 저지연 분석 워크로드 실행
NVIDIA는 DGX B200 및 GB200 NVL72 환경에서 GPU 가속 Presto를 활용해 TPC-H 벤치마크 기준 CPU 클러스터 대비 최대 8배 낮은 지연 시간을 달성했음을 입증했습니다. cuDF, NVLink, GPUDirect Storage(GDS) 기술을 통해 데이터 전송 병목을 제거하고 대규모 분석 워크로드의 처리 속도를 혁신적으로 높였습니다.
Running Low-Latency Analytical Workloads with GPU-Accelerated Presto on NVIDIA GB200 NVL72↗developer.nvidia.com




![[AI는 지금] 엔비디아 H200 손에 넣는 中 AI…딥시크·알리바바 성능 경쟁 빨라지나](https://startupschool.cc/og/ai는-지금-엔비디아-h200-손에-넣는-中-ai딥시크알리바바-성능-경쟁-빨라지나-428df2.jpg)






