AI 모델 (LLM·GPT·Claude·Gemini)
GPT, Claude, Gemini, Llama 등 AI 모델(LLM) 출시·벤치마크·API 변경사항을 모읍니다.
최신 업데이트
AI 모델 관련 글 — 180 페이지
- 0
세 가지 API를 위한 세 가지 대기 시간: Steam 250ms, GitHub 100ms, HuggingFace 없음
이 글은 Steam, GitHub, HuggingFace 세 가지 플랫폼의 API를 활용한 ETL 파이프라인 구축 사례를 통해 각기 다른 레이트 리밋(Rate Limit) 대응 전략을 설명합니다. 개발자는 인증 토큰 활용과 적절한 슬립(sleep) 간격 설정을 통해 데이터 수집 실패를 최소화하고 시스템 안정성을 확보할 수 있습니다.
Three sleep intervals for three APIs: Steam 250ms, GitHub 100ms, HuggingFace none↗dev.to
- 3
일관성 있는 eBee를 추적한 4년 – 그리고 마침내 잡았을 때 내가 구축한 것
작성자는 Midjourney와 ChatGPT를 거치며 캐릭터 일관성 유지의 어려움과 대화 맥락이 변하는 '드리프트(drift)' 현상을 경험했습니다. 이를 해결하기 위해 AI 모델에 의존하지 않고 YAML 스펙을 기반으로 프롬프트를 생성하고 실행하는 결정론적 도구인 'panelgen'을 개발하여 캐릭터 일관성을 확보했습니다.
Four years chasing a consistent eBee — and what I built when I finally caught one↗dev.to
- 4
내일의 월드컵 경기 예측: 스마트 LLM 라우팅으로 10배 트래픽 급증 처리 및 비용 42% 절감 방법
월드컵과 같은 대규모 이벤트 기간 중 발생하는 AI 서비스의 트래픽 폭증 및 API 비용 문제를 해결하기 위해, 질문의 난이도에 따라 저가형 모델과 고가형 모델을 지능적으로 배분하는 'PandasRouter' 솔루션을 소개합니다. 이 기술은 비용을 42% 이상 절감하면서도 서비스 가용성을 높이는 성과를 보여주었습니다.
Title: Predicting Tomorrow’s World Cup Clashes: How we handle a 10x traffic spike using smart LLM routing (And cut costs by 42%)↗indiehackers.com
- 6
바이브신커: 추론 능력에서 오푸스 4.5를 능가하는 30억 파라미터 모델, 새로운 SFT+GRPO 방식 적용
VibeThinker-3B는 'Spectrum-to-Signal'이라는 새로운 학습 패러다임을 통해 소형 모델에서도 고도의 검증 가능한 추론 능력을 구현했습니다. 이 모델은 AIME26과 LiveCodeBench 등에서 압도적인 성적을 거두며, 특정 지능 영역은 파라미터 압축이 가능하다는 가설을 뒷받침합니다.
VibeThinker: 3B param model that beats Opus 4.5 on reasoning with novel SFT+GRPO↗arxiv.org
- 9
오늘의 오픈 소스 프로젝트 (#103): Voicebox – ElevenLabs의 로컬, 오픈 소스 대안
Voicebox는 7개의 다양한 TTS 엔진과 제로샷 보기 클로닝, 멀티트랙 에디터를 통합한 로컬 실행형 데스크톱 애플리케이션입니다. 모든 프로세스가 온디바이스(On-device)로 이루어져 개인정보 유출 걱정 없이 고품질의 음성 생성 및 딕테이션 기능을 무료로 사용할 수 있습니다.
Open Source Project of the Day (#103): Voicebox — A Local, Open-Source Alternative to ElevenLabs↗dev.to
- 11
넷플릭스 초기 연구 탐색: 더욱 제어 가능한 AI 비디오 편집으로 향하다
넷플릭스는 원본 영상을 보완하여 예고편, 티저, 소셜 미디어용 단편 영상 등 홍보 콘텐츠를 제작하는 기술을 개발하고 있습니다. 이번 연구의 핵심은 단순한 자동화를 넘어 창작자의 비전을 정확히 구현할 수 있는 '제어 가능한(controllable)' AI 편집 기술을 구축하는 것입니다.
Toward More Controllable AI Video Editing: An Early Research Exploration at Netflix↗netflixtechblog.com
- 14
Moebius: 100억 수준의 성능을 가진 0.2B 이미지 인페인팅 모델
Moebius는 기존 10B 이상의 거대 모델 대비 파라미터 수를 2% 미만으로 줄이면서도 FLUX.1-Fill-Dev와 대등하거나 뛰어난 인페인팅 품질을 제공하는 초경량 프레임워크입니다. LλMI 블록과 적응형 다중 그래<0xEB><0x89><0xBC>러티 증류 전략을 통해 연산 비용은 획기적으로 낮추고 생성 품질은 유지하는 데 성공했습니다.
Moebius: 0.2B image inpainting model with 10B-level performance↗hustvl.github.io
- 19
로컬 LLM 운영 비용은 실제 얼마일까? (100만 토큰당 € 기준, 측정값 포함)
RTX 3090 환경에서 모델별 토큰당 실제 전력 소모량을 측정한 결과, 초소형 모델은 클라우드 대비 매우 저렴하지만 대형 모델은 전기 비용만으로도 API 사용보다 비쌀 수 있음을 확인했습니다. 핵심은 '토큰당 비용 = 전력량 ÷ 처리량'이며, 효율적인 아키텍처 선택이 운영 비용 최적화의 관건입니다.
How Much Does It Actually Cost to Run a Local LLM? (€ per Million Tokens, Measured)↗dev.to
- 20
CPU에서 로컬 AI 메모리 게이트를 구축했더니, 7B 모델이 1.5B 모델보다 성능이 저조했는데 너무 똑똑해서 그랬다
Hillock은 로컬 LLM을 위한 경량화된 오프라인 메모리 레이어로, SQLite와 Hebbian plasticity, HDC 기술을 활용해 VRAM 소모를 최소화하며 컨텍스트를 관리합니다. 특히 모델의 표현력이 높아질수록 기존의 엄격한 평가 방식에서는 성능이 낮게 측정되는 '지능형 모델의 역설' 현상을 보여주며 새로운 데이터 추출 가능성을 제시합니다.
I built a local AI memory gate on a CPU, and my 7B model scored worse than my 1.5B model because it was too smart↗dev.to














