AI 모델 (LLM·GPT·Claude·Gemini)
GPT, Claude, Gemini, Llama 등 AI 모델(LLM) 출시·벤치마크·API 변경사항을 모읍니다.
최신 업데이트
AI 모델 관련 글 — 6 페이지
- 1
엔비디아, 이제는 AI 모델이 아닌 하니스(harness)가 진짜 영웅임을 증명했다
엔비디아 연구진은 적절한 하니스와 '감독(supervisor)' 컴포넌트를 활용할 경우 Claude Opus 5가 ARC-AGI-3 벤치마크에서 100%의 점수를 기록했음을 보여주었습니다. 이는 모델의 지능만큼이나 도구 사용, 메모리 관리, 피드백 루프를 설계하는 에이전트 시스템의 구조적 설계가 중요함을 시사합니다.
Nvidia just showed that the harness, not the AI model, is now the real hero↗techcrunch.com
- 6
시뮬레이션: 새로운 스케일링 법칙 — 준성 박, 심일레 AI
Generative Agents 연구로 유명한 Simile AI가 인간 행동의 디지털 트윈을 구축하여 실제 인간 포커스 그룹과 8모델 대비 85~99% 일치하는 수준의 시뮬레이션 기술을 선보였습니다. 이들은 단순 프롬프팅을 넘어 인과 관계와 사회적 물리 법칙을 모델링함으로써 제품 테스트, 정책 수립, 나아가 기후 변화 대응까지 가능한 거대 시뮬레이션 생태계를 목표로 합니다.
Simulation: the new Scaling Law — Joon Sung Park, Simile AI↗latent.space
- 10
중간 토큰을 추론/사고의 흔적으로 인간화하는 것을 멈춰라 (2025)
최근 LLM 성능 향상을 위해 중간 토큰 생성(ITG) 방식이 표준화되었으나, 이를 '추식 흔적'이나 '사고 과정'으로 부르는 것은 모델을 인간처럼 의인화하는 오류를 범하게 합니다. 저자들은 이러한 용어 사용이 모델의 본질을 왜곡하고 잘못된 연구와 활용으로 이어질 수 있다고 주장하며 명칭 사용 중단을 촉구합니다.
Stop Anthropomorphizing Intermediate Tokens as Reasoning/Thinking Traces (2025)↗arxiv.org
- 15
당신의 브랜드가 AI에 의해 '언멘션(Mentioned)'되고 있습니다. 그것은 당신이 생각하는 의미가 아닙니다.
AI 어시스턴트가 브랜드를 언급하더라도 실제 출처를 제공하지 않는 경우가 상당하며, 이는 단순 학습 데이터의 잔재나 환각(Hallunincation)일 가능성이 높습니다. 따라서 창업자는 브랜드의 인지도(Mention rate)뿐만 아니라 근거 있는 노출(Citation rate)을 관리하는 전략이 필요합니다.
Your brand is 'mentioned' by AI. That doesn't mean what you think.↗indiehackers.com


















