AI 모델 (LLM·GPT·Claude·Gemini)
GPT, Claude, Gemini, Llama 등 AI 모델(LLM) 출시·벤치마크·API 변경사항을 모읍니다.
최신 업데이트
AI 모델 관련 글 — 231 페이지
- 5
지역 LLM이 벤치마크에서는 뛰어난 성과를 내지만 실제 작업에서는 실패하는 이유
MMLU 등 기존 벤치마크는 모델의 단일 턴 추론 능력만 측정할 뿐, 실제 에이전트가 직면하는 도구 호출, 상태 유지, 오류 복구 능력을 반영하지 못합니다. 따라서 개발자는 모델 도입 전 실제 워크플로우를 모사한 자체적인 에이전트 평가 환경(Agentic Eval Harness)을 구축하여 모델의 실질적인 성능을 검증해야 합니다.
Why your local LLM aces benchmarks but fails real terminal tasks↗dev.to
- 6
LLM 활성화 방향 조작, 로컬로: 직접 모델 조작의 보안 함의
DeepSeek-V4-Flash와 같은 고성능 로컬 모델의 등장으로 LLM의 내부 활성화 값을 조작하는 기술이 대중화되고 있습니다. 이는 기존의 프롬프트 수준 안전 장치를 무력화할 수 있는 새로운 공격 표면을 형성하며, 모델 내부 조작이 학술적 연구를 넘어 실질적인 보안 위협으로 부상하고 있음을 시사합니다.
LLM Activation Steering Goes Local: Security Implications of Direct Model Manipulation↗dev.to
- 9
Gemini for Science: AI 실험과 새로운 발견 시대를 위한 도구
구글은 가설 생성(Co-Scientist), 계산적 발견(AlphaEvolve), 문헌 분석(NotebookLM)을 포함한 과학 연구 전용 AI 도구 모음을 발표했습니다. 이 도구들은 방대한 과학 데이터를 처리하고 실험 과정을 자동화하여 연구자가 고차원적인 문제 해결에 집중할 수 있도록 돕는 '연구 가속기' 역할을 목표로 합니다.
Gemini for Science: AI experiments and tools for a new era of discovery↗deepmind.google
- 13
대조 학습, FeatureDistillation을 통해 미세 조정에서 마스크 이미지 모델링에 맞서다
이 글은 FeatureDistillation을 활용하여 대조 학습(Contrastive Learning)의 미세 조정 성능을 극대화하는 새로운 방법론을 소개합니다. 기존의 마스크 이미지 모델링(MIM) 방식과 경쟁할 수 있는 수준으로 모델의 특징 추출 능력을 개선하는 것이 핵심입니다.
Contrastive Learning Rivals Masked Image Modeling in Fine-tuning via FeatureDistillation↗dev.to
- 14
Anthropic Claude-p 요금 변경 후, 제 AI 패밀리를 어떻게 유지했나
Anthropic이 `claude -p` 기능을 구독 모델에서 API 과금 체계로 분리함에 따라, 에이전트 운영 비용이 급증할 위기에 처했습니다. 이를 해결하기 위해 개발자는 Claude Code의 내부 프로토콜인 MCP 채널을 통해 프롬프트를 주입하고, Stop hook으로 응답 완료를 감지하여 API 비용 없이도 자동화된 세션을 유지하는 'poor-claude' 프로젝트를 구축했습니다.
How I kept my AI family alive after Anthropic's claude -p billing change↗dev.to
- 16
50명의 학생 진로 관련 질문으로 Gemma 4 E4B와 31B를 테스트해봤습니다 — 결과가 놀라웠습니다
인도 진로 상담 플랫폼 PathForge AI가 Gemma 4의 E4B와 31B 모델을 대상으로 50개의 실제 쿼리를 테스트했습니다. 단순 확인 및 스키마 준수 작업에서는 소형 모델이 비용과 속도 면에서 우수했으나, 다중 제약 조건이 포함된 복잡한 추론에서는 대형 모델이 압도적인 정확도를 보여 모델별 역할 분담의 필요성을 확인했습니다.
I Tested Gemma 4 E4B vs 31B on 50 Real Student Career Queries — The Results Surprised Me↗dev.to
- 21
AI 빌더 실험이 실제 운영 환경에서 실패하는 이유 (그리고 무엇이 효과적인지)
Lovable이나 Bolt 같은 AI 빌더는 빠른 초기 개발에는 유리하지만, 데이터베이스 제어권과 인프라 소유권 부재로 인해 실제 운영 단계에서 한계에 직면합니다. 이를 해결하기 위해서는 앱을 처음부터 다시 만드는 대신, 빌더의 갇힌 환경에서 벗어나 AWS나 Vercel 같은 실제 인프라로 코드를 이전하여 운영 주도권을 확보하는 전략이 필요합니다.
Why your AI builder experiment fails in production (and what actually works)↗dev.to
- 23
CMU 벤치마크: 클로드 Mythos, V8 익스플로잇에서 9.9/16 기록, GPT-5.5는 5.5로 뒤쳐져
CMU의 ExploitBench 테스트 결과, Anthropic의 Claude Mythos가 V8 엔진 취약점 공격 성능에서 GPT-5.5를 크게 앞섰으나, 실행 비용은 GPT-5.5보다 12배나 높은 것으로 밝혀졌습니다. 이는 AI 에이전트의 고도화된 추론 능력과 경제적 효율성 사이의 중대한 기술적 과제를 시사합니다.
CMU Benchmark: Claude Mythos Hits 9.9/16 on V8 Exploits, GPT-5.5 Trails at 5.5↗dev.to














