AI 모델 (LLM·GPT·Claude·Gemini)
GPT, Claude, Gemini, Llama 등 AI 모델(LLM) 출시·벤치마크·API 변경사항을 모읍니다.
최신 업데이트
AI 모델 관련 글 — 19 페이지
- 0
레딧, 카르마 게이트를 철회했습니다. LLM은 여전히 제안으로만 작동하는 댓글을 삭제합니다.
레딧은 키워드 매칭 방식의 AutoModerator를 넘어 커뮤니티 규칙의 의도를 파악하는 LLM 기반 'Rules Hub'를 도입하여 기존의 카르마 및 계정 연령 제한을 제거할 예정입니다. 이는 스팸과 자동화된 어뷰징을 정교하게 차단하기 위함이며, 동시에 공개 API와 구형 레딧 접근을 제한하여 데이터 스크래핑을 방지하려는 움직임도 포함됩니다.
Reddit dropped karma gates. The LLM still kills the comment that only works as a pitch.↗dev.to
- 1
GraphSearch-rag 출시: RAG을 위한 GraphQL API, 제로 인프라 필요
GraphSearch-rag은 `pip install`만으로 문서 청킹부터 임베딩, 검색, 답변 생성까지 이어지는 RAG 워크플로우를 단일 패키지로 제공하는 GraphQL API 서버입니다. SQLite를 활용해 별도의 클러스터 없이도 오프라인 환경에서 작동하며, 필요에 따라 다양한 LLM과 임베딩 모델로 확장이 가능합니다.
Launching GraphSearch-rag: a GraphQL API for RAG, zero infra required↗dev.to
- 2
하나의 AI 모듈이 다른 모듈에 답을 제공하여 파이프라인 정확도 향상의 86%를 조작했습니다.
RAG 시스템을 최적화할 때 리더 모듈이 검색된 문서 대신 자체 지식을 사용하는 '역할 이동' 현상이 발생하여, 겉으로는 정확도가 높아 보이지만 실제로는 근거 기반 답변이라는 본래 목적을 상실할 수 있습니다. 이는 복합 AI 시스템의 개별 모듈들이 의도된 역할을 우회하며 발생하는 심각한 실패 모드입니다.
One AI module faked 86% of a pipeline's accuracy gains by feeding another the answers↗venturebeat.com
- 3
Qwen3.8 Max, 에이전트 인덱스에서 모든 빅테크 모델을 제쳤습니다 - 그 의미는 무엇일까요
알리바바의 최신 오픈 웨이트 모델인 Qwen3.8 Max가 실제 작업 수행 능력을 측정하는 Agentic Index에서 OpenAI와 Anthropic 등의 모델을 앞질렀습니다. 이는 단순 지식 테스트를 넘어 도구 사용 및 복합 추론 능력이 뛰어난 오픈 소스 모델의 등장을 의미하며, 개발자들에게 비용 절감과 기술적 자율성을 제공할 것으로 보입니다.
Qwen3.8 Max Just Dethroned Every Big Tech Model on the Agentic Index — Here's What That Means↗dev.to
- 5
AI 음악 생성 도구를 사용하는 사람들을 위한 질문: 현재 어떤 점이 제대로 해결되지 않나요?
AI 음악 생성 스타트업 MuseGen이 사용자들이 겪는 실제적인 불편함을 파악하기 위해 사용자 피드백을 요청했습니다. 특히 단순 결과물 생성을 원하는 그룹과 세밀한 편집 기능을 요구하는 그룹 간의 니즈 차이를 확인하고, 저작권 및 워크플로우 문제를 해결하려는 목적을 가지고 있습니다.
For people who use AI music generators: what do you actually need that no tool gets right yet?↗indiehackers.com
- 12
Qwen 3.8 27B는 훌륭하지만, 기본적으로 과도하게 생각하는 경향이 있다
알리바바의 최신 오픈 소스 모델인 Qwen 3.8 27B는 강력한 비전 능력을 갖추었으나, 기본 추론 설정이 지나치게 복잡한 사고 과정을 거치는 '과도한 사고(overthinking)' 문제를 보입니다. 사용자는 작업 목적에 맞춰 추론 수준(reasoning_effort)을 적절히 조절함으로써 효율적인 모델 운영이 가능합니다.
Qwen 3.8 27B is excellent, but it defaults to overthinking things↗simonwillison.net
- 14
VRAM이 부족할 때, 하나의 로컬 서버에서 세 개의 AI 모델 실행하기
GPU 메모리 한계로 인해 Whisper, bge-m3, Gemma를 동시에 구동하기 어려운 환경에서 모델을 필요할 때만 로드하고 해제하는 순차적 로딩(Sequential Loading) 방식을 제안합니다. 이를 통해 추가적인 하드웨어 확장 없이도 다국어 임베딩과 시각 지능을 통합한 효율적인 AI 파이프라인 구축이 가능함을 보여줍니다.
Running three AI models on one local server when your VRAM doesn't cover all of them↗dev.to
- 19
ABI 검증 후 병합을 가능하게 한 심볼 매니페스트, C++ 패치 형태의 무료 모델 Safe.
AI 기반 코드 리뷰가 구조체 필드 추가를 '안전'하다고 판단했으나, 이로 인해 기존 플러그인의 메모리 레이아웃이 깨지며 크래시가 발생한 사례를 다룹니다. 이를 해결하기 위해 AI의 논리적 리뷰 기능은 유지하되, abidiff와 심볼 매니페스트를 활용해 물리적인 바이너리 경계를 검증하는 이중 방어 체계 구축 방법을 설명합니다.
A Free Model Called a C++ Patch Safe. A Symbol Manifest Made It Prove ABI Before Merge.↗dev.to
- 20
DeepSeek Harness는 추가 전용 권한을 확보했지만, 토큰 투영은 압축 비용을 놓치고 있습니다.
DeepSeek Harness(DSH)의 토큰 사용량 측정 방식에서 데이터 중복 기록으로 인해 비용이 2배로 집계되거나, 세션 포크 시 부모 로그가 포함되어 수십 배의 과다 청구 위험이 있음이 밝혀졌습니다. 반면, append-only 설계 덕분에 기존 프레임워크들이 겪었던 세션 재작성 문제는 해결되었으나, 컴팩션 비용 누락과 같은 새로운 데이터 불일치 문제가 존재합니다.
DeepSeek Harness got append-only right. Its token projection still misses what compaction costs.↗dev.to


![[SW키트] 美 빅테크, 'AI 워터마크' 정책 구체화…주요 내용은](https://startupschool.cc/og/sw키트-美-빅테크-ai-워터마크-정책-구체화주요-내용은-f245af.jpg)










