AI 모델 (LLM·GPT·Claude·Gemini)
GPT, Claude, Gemini, Llama 등 AI 모델(LLM) 출시·벤치마크·API 변경사항을 모읍니다.
최신 업데이트
AI 모델 관련 글 — 5 페이지
- 1
Qwen-UI-Agent, 알리바바가 공개한 AI 모델로 모바일 및 컴퓨터 제어
알리바바의 Qwen-UI-Agent는 시뮬레이션 환경을 넘어 실제 기기에서 모바일과 컴퓨터를 직접 조작할 수 있는 오픈소스 GUI 에이전트 파운데이션 모델입니다. 이 모델은 벤치마크 테스트에서 기존 플래그십 모델들을 압도하는 성능을 보였으며, 배치 명령 처리와 안전 메커니즘을 통해 실질적인 작업 수행 능력을 입증했습니다.
Qwen-UI-Agent, โมเดลที่ Alibaba เปิดซอร์สให้ AI ควบคุมมือถือและคอมพิวเตอร์จริง ไม่ได้มีเพียงจำลอง↗dev.to
- 2
OpenAI, Codex Harness 공개 - GPT-5.6 성능 3배 향상 및 토큰 6배 감소
OpenAI가 AI 에이전트의 실행 및 제어를 담당하는 'Codex Harness'를 Apache-2.0 라이선스로 오픈소스로 공개했습니다. 이 시스템은 단순한 챗봇 형태를 넘어 IDE나 대시보드 등 기존 소프트웨어 워크플로우에 AI 에이전트를 직접 내재화할 수 있는 인프라를 제공합니다.
OpenAI เปิดซอร์ส Codex Harness, ระบบที่ทำให้ GPT-5.6 Sol เก่งขึ้น 3 เท่า และลด token ลง 6 เท่า↗dev.to
- 3
DeepSeek RC.8 활용, ‘경쟁사를 부하로 삼다’ 전략 그리고 하루 만에 3만 개의 스타가 된 이유
DeepSeek은 최근 출시한 Harness RC.8을 통해 Claude Code와 Codex를 자사 시스템의 sub-agent로 활용하는 '경쟁사를 부하로 삼는' 전략을 발표했습니다. 이는 모델 자체의 성능 경쟁보다는 다양한 에이전트를 통합 관리하는 오케스트레이션 레이어를 장악하여 AI 생태계의 중심이 되겠다는 의지를 보여줍니다.
DeepSeek Harness RC.8, กลยุทธ์ 'เอาคู่แข่งมาเป็นลูกน้อง' และทำไม 30,000 stars ในวันเดียวถึงสำคัญ↗dev.to
- 7
[AINews] 10% 더 나쁘지만, 100배 저렴하고, 1만 배 빠르다: 시뮬레이션이 장악하는 이유
AI 개발의 전 과정이 인간 중심에서 모델 기반의 합성 데이터와 자가 학습 루프로 빠르게 대체되고 있으며, 이는 성능 손실을 최소화하면서도 압도적인 비용 효율성을 제공합니다. 보상 모델부터 연구 프로세스까지 모든 단계가 시나리오 기반의 자동화된 시뮬레이션으로 진화하고 있습니다.
[AINews] 10% worse, 100x cheaper, 10000x faster: Why Simulation is taking over↗latent.space![[AINews] 10% 더 나쁘지만, 100배 저렴하고, 1만 배 빠르다: 시뮬레이션이 장악하는 이유](https://startupschool.cc/og/ainews-10-worse-100x-cheaper-10000x-faster-why-simulation-is-taking-over-b7e110.jpg)
- 9
DeepSeek V4 Flash Vision Experimental, AI Gateway에서 사용 가능
Vercel AI Gateway가 이미지 분석 및 텍스트 추출 기능이 포함된 DeepMS DeepSeek V4 Flash Vision Experimental 모델 지원을 시작했습니다. 이 모델은 JPEG, PNG 등 다양한 이미지 형식을 처리할 수 있으며 기존의 도구 사용, 추론, 캐싱 기능을 그대로 유지합니다.
DeepSeek V4 Flash Vision Experimental now available on AI Gateway↗vercel.com
- 12
Show HN: Public Muscriptor 인스턴스 (최신, 가장 강력한 오디오-MIDI 모델)
Public Mus토는 MP3, WAV, 유튜브 링크를 피아노 MIDI 데이터로 변환해주는 브라우저 기반 AI 서비스입니다. 사용자는 별도의 설치 없이 웹에서 오디오를 악보와 MIDI로 추출하고, Steinway 그랜드 피아노 사운드로 즉시 확인하며 MusicXML로 내보낼 수 있습니다.
Show HN: Public Muscriptor Instance (latest, most powerful Audio-to-MIDI model)↗pianoify.net
- 16
Claude Mythos 5의 사이버 보안 역량을 더 많은 방어자들에게 제공
Anthropic은 사이버 보안 방어력을 강화하기 위해 Claude Mythos 5를 보안 파트너사의 도구와 Claude Security에 본격적으로 도입합니다. 또한 오픈소스 보안 강화를 위한 3,500만 달러 규모의 기금(0xDAF)을 조성하고 사이버 검증 프로그램을 확대하여 안전한 AI 보안 생태계를 구축할 계획입니다.
Bringing the cybersecurity capabilities of Claude Mythos 5 to more defenders↗claude.com
- 18
How to Choose the Right Enterprise AI RAG System을 자연스럽게 번역하면 다음과 같습니다. 올바른 Enterprise AI RAG 시스템 선택 방법
엔터프라이즈 RAG 시스템은 단순한 답변 생성을 넘어 데이터 인제스션, 권한 제어, 신뢰성 평가 등 복잡한 운영 사이클을 완성해야 합니다. 성공적인 도입을 위해서는 벡터 DB 선택에 앞서 구체적인 유스케이스를 정의하고, 소스 커버리지와 보안 및 검색 품질을 검증하는 10가지 핵심 기준을 적용해야 합니다.
How to Choose the Right Enterprise AI RAG System↗dev.to
- 20
OpenAI GPT-5.6 가격 업데이트, 테라 및 루나 비용 감소, 솔은 변동 없음
OpenAI는 GPT-5.6 모델 중 Luna의 가격을 80%, Terra를 20% 인하하여 저비용 옵션의 경제성을 강화했습니다. 반면 플래그십인 Sol의 기본 가격은 유지하되, 비용이 두 배로 드는 대신 속도가 2.5배 빠른 'Fast mode'를 새롭게 추가하며 성능과 비용 사이의 선택지를 넓혔습니다.
OpenAI GPT-5.6 Pricing Update Cuts Terra and Luna Costs, Leaves Sol Unchanged↗dev.to
- 22
MCP는 발견 문제를 안고 있다. 모든 7만 5천 서버를 검색하는 메타서버를 구축했다.
기존 MCP 방식은 사용자가 직접 서버를 찾아 설정해야 하며, 많은 서버 추가 시 토큰 비용이 급증하는 한계가 있습니다. mcp-anything은 대규모 MCP 서버 인덱스를 구축하여 검색과 실행을 단일 서버 내에서 처리함으로써 컨텍스트 비용을 일정하게 유지하고 자동화된 도구 발견을 가능케 합니다.
MCP has a discovery problem. I built a meta-server that searches all 75,000 servers.↗dev.to
- 23
제 요금제에서 가장 저렴한 모델은 모든 벤치마크에서 패배합니다. 하지만 가격이 14배 더 비싼 모델들을 이깁니다.
벤치마크 성능은 다소 낮지만 매우 저렴하고 요청 한도가 월등히 높은 모델(MiMo-V2.5)이, 오히려 더 비싸고 성능도 낮은 중가형 모델들을 압도한다는 분석입니다. 이는 AI 서비스 개발 시 단순 성능 지표를 넘어 토큰 비용과 쿼터 소모율을 종합적으로 고려해야 함을 시사합니다.
The cheapest model on my plan loses every benchmark. It still beats models charging 14x more.↗dev.to




![[8월21일] 오픈AI가 ‘컴퓨터 유즈’에 보인 자신감…9년간 이어온 ‘행동하는 AI’의 현재](https://startupschool.cc/og/8월21일-오픈ai가-컴퓨터-유즈에-보인-자신감9년간-이어온-행동하는-ai의-현재-73df93.jpg)







