AI 모델 (LLM·GPT·Claude·Gemini)
GPT, Claude, Gemini, Llama 등 AI 모델(LLM) 출시·벤치마크·API 변경사항을 모읍니다.
최신 업데이트
AI 모델 관련 글 — 116 페이지
- 5
LLM이 컴퓨터 아키텍처 논문에 대한 심층적인 기술적 이해를 수행할 수 있을까?
연구진은 5개의 독립적인 전문가 페르소나와 적대적 합성 단계를 거치는 'Gauntlet' 파이프라인을 통해 LLM의 논문 분석 능력을 평가했습니다. 실험 결과, Gauntlet은 인간 전문가보다 높은 비판적 엄밀성을 보였으며, 이러한 성능 향상은 단일 에이전트가 아닌 멀티 에이전트 구조와 합성 과정에서 기인한 것으로 나타났습니다.
Can LLMs Perform Deep Technical Comprehension of Computer Architecture Papers↗arxiv.org
- 7
이니하우스의 '워칭 에이전트': 실시간 AI 확률 점수를 활용한 실제 제품 질문 추적
이니하우스가 개발한 '워칭 에이전트'는 미래에 대한 질문을 입력하면 AI가 가설을 세우고 웹상의 증거를 찾아 확률(Probability)과 신뢰도(Confidence) 점수를 실시간으로 업데이트하는 서비스입니다. 이를 통해 창업자는 단순한 정보 소비를 넘어, 데이터의 변화 흐름을 추적하며 제품 개발 및 피벗 여부를 결정하는 구조적인 워크플로우를 구축할 수 있습니다.
Watching Agents by Inithouse: tracking a real product question with live AI probability scores↗dev.to
- 8
줌(Zoom) 통화 연결 방식은 단 세 가지뿐이며, 이는 노트 필기 앱의 모든 것을 결정한다
AI 노트 테이커는 Zoom에 데이터를 가져오는 방식에 따라 봇 참여형, 플랫폼 내장형, 로컬 오디오 캡처의 세 가지 유형으로 분류됩니다. 각 방식은 가시성, 비용 효율성, 보안성 측면에서 서로 다른 트레이드오프를 가지므로 사용자의 환경에 맞는 기술적 접점을 선택하는 것이 핵심입니다.
There are only three ways to tap a Zoom call — and it decides everything about your notetaker↗dev.to
- 10
Inkling: Thinking Machines Lab의 오픈 웨이트 MoE 모델 – 벤치마크, 아키텍처, 그리고 실제 경쟁하는 부분
Thinking Machines Lab이 공개한 Inkling은 975B 파라미터 규모의 MoE 모델로, 텍스트, 이미지, 오디오, 비디오를 아우르는 네이티브 멀티모달 기능을 제공합니다. 복잡한 추론 능력에서는 최상위 폐쇄형 모델에 뒤처지지만, 자가 미동 조정(Self-Fine-Tuning) 플랫폼인 Tinker와의 결합을 통해 오픈 웨이트 생태계의 새로운 비즈니스 모델을 제안하고 있습니다.
Inkling: Thinking Machines Lab's Open-Weights MoE Model — Benchmarks, Architecture, and What It Actually Competes On↗dev.to
- 13
AI 컨텍스트 격차: 기업 AI 조직은 검색 문제보다 신뢰 문제를 안고 있으며, 대부분 아직 해결책을 구축 중
기업용 AI 에이전트에 비즈니스 맥락을 전달하는 RAG 기술과 인프라는 빠르게 발전하고 있지만, 데이터 누락 및 불일치로 인한 '신뢰 문제'가 여전히 해결되지 않은 상태입니다. 공급업체의 자체 검색 기능이 전문 벡터 DB를 대체하는 추세 속에서, 정확한 답변 생성을 위한 관리된 의미 체계(governed semantic layer)의 필요성이 대두되고 있습니다.
The AI context gap: Enterprise AI organizations have a trust problem, not a retrieval problem — and most are still building the fix↗venturebeat.com
- 16
모델 벤치마크, 고정 실행 레이어가 없을 때 브라우저 상태 추첨제로 변모
브라우저 기반 코딩 모델 벤치마크에서 쿠키나 세션 상태 등 환경적 변수가 결과에 미치는 영향을 최소화하기 위해 실행 레이어를 고정하는 기술이 소개되었습니다. OpenCode와 BrowserAct는 브라우저 정체성, 작업 계약, 재시도 예산 등을 통제하여 모델의 순수 성능을 측정할 수 있는 안정적인 실행 환경을 제공합니다.
Model benchmarks become browser-state lotteries without a fixed execution layer↗indiehackers.com
- 17
원격 MCP 서버 구축 및 배포: Claude Desktop에 비용 추적기를 연결하면서 얻은 교훈
개발자가 MCP를 사용하여 원격 서버 기반의 비용 추적 도구를 구축하고 Claude Desktop에 통합하는 과정을 다룹니다. 단순한 로컬 튜토리얼을 넘어, Windows MSIX 가상화로 인한 설정 파일 경로 문제와 외부 서비스 연동을 위한 OAuth 인증 관리의 실무적 어려움을 상세히 설명합니다.
Building and Deploying a Remote MCP Server: Lessons from Connecting an Expense Tracker to Claude Desktop↗dev.to
- 20
Inithouse의 Voice Tables: 음성 우선 AI 작업 공간 운영 결과 측정 내용
Inithouse는 음성 우선 AI 워크스페이스인 'Voice Tables'의 운영 데이터를 통해, 음성 입력이 키보드 방식보다 작업 완료율과 사용자 유지율을 유의미하게 높인다는 사실을 발견했습니다. 사용자는 자연어를 통해 복지 구조를 정의함으로써 초기 구축 시간을 단축하고 더 높은 생산성을 보였습니다.
Voice Tables by Inithouse: what we measured running a voice-first AI workspace↗indiehackers.com














