Codex 뉴스
코드 생성 AI 모델 Codex의 발전과 개발 자동화 트렌드를 다룹니다.
총 146건·최신 업데이트
- 63
Show HN: Caliper - Claude Code 및 Codex 기술의 신뢰성 테스트를 위한 pass@k 방식
Caliper는 Claude Code나 Codex 같은 AI 에이전트의 스킬 성능을 반복 실행을 통해 측정하고, 기존 에이전트와의 성능 차이를 시각적으로 보여주는 테스트 프레임워크입니다. 사용자는 LLM 기반의 자동 평가와 파이썬 코드를 이용한 결정론적 검증을 결합하여 에이전트의 안정성을 체계적으로 관리할 수 있습니다.
Show HN: Caliper – pass@k reliability testing for Claude Code and Codex skills↗github.com
- 64
OpenAI Codex, 민감 파일 제외 문제 해결 방안 아직 미결
OpenAI Codex의 Rust 기반 구현체인 codex-rs에서 보안상 위험한 파일이나 불필요하게 큰 파일을 AI 모델의 읽기 범위에서 제외할 수 있는 메커니즘이 없다는 이슈가 제기되었습니다. 개발자는 .codexignore와 같은 명시적인 설정 파일을 통해 팀 전체가 공유할 수 있는 결정론적인 보안 규칙을 요구하고 있습니다.
A way to exclude sensitive files issue still open for OpenAI Codex↗github.com
- 66
[AINews] OpenAI, Codex 내부 출력 토큰 미디어 값 지난 2025년 11월 이후 연구 분야서 56배, 고객 지원 분야서 32배, 엔지니어링 분야서 27배, 법무 분야서 13배 증가
OpenAI 내부 데이터에 따르면 2025년 말 이후 연구(56배), 고객 지원(32배) 등 전 부서의 Codex 토큰 사용량이 급격히 증가하며 AI 에이전트 도입이 가속화되고 있습니다. 동시에 GLM-5.2와 같은 고성능 오픈 모델의 등장과 구글 제미적 3.5 Flash의 '컴퓨터 사용' 기능 출시로 인해, 자율적 실행력을 갖춘 에이전트 인프라 경쟁이 본격화되고 있습니다.
[AINews] OpenAI reports median internal Codex output tokens grew 56x in Research, 32x in Customer Support, 27x in Engineering, and 13x in Legal since November 2025.↗latent.space![[AINews] OpenAI, Codex 내부 출력 토큰 미디어 값 지난 2025년 11월 이후 연구 분야서 56배, 고객 지원 분야서 32배, 엔지니어링 분야서 27배, 법무 분야서 13배 증가](https://startupschool.cc/og/ainews-openai-reports-median-internal-codex-output-tokens-grew-56x-in-research-3.jpg)
- 70
Show HN: Cowork/Codex DOCX 플러그인. 문서 파일 처리 시 토큰 사용량을 절반으로 줄입니다.
LegalRabbit에서 개발한 이 플러그인은 LLM을 위해 설계된 전용 엔진을 통해 .docx 파일의 읽기, 생성, 수정 및 코멘트 관리를 지원합니다. 기존 방식 대비 토큰 소모를 2~5배 줄여 비용 효율성과 처리 속도를 동시에 높였으며, 오프라인 작동을 통해 데이터 보안성도 확보했습니다.
Show HN: Cowork/Codex DOCX plugin. Uses 2x fewer tokens than the docx skill↗github.com
- 71
아키텍트: Fable 토큰 80% 감소, Fable 오케스트레이션/리뷰, Codex 빌드
이 프로젝트는 Claude Code를 기획 및 검증 단계에, GPT 기반 모델을 구현 및 조사 단계에 배치하여 에이전트의 신뢰성을 높이는 워크플로우를 제안합니다. 특히 Git worktree를 활용한 병렬 실행과 엄격한 테스트 게이트(Gate) 시스템을 통해 AI 에이전트가 생성한 코드의 무결성을 보장하는 데 집중합니다.
/architect: Reduce Fable tokens by 80%, Fable orchestrates/reviews, Codex builds↗github.com
- 72
Anthropic의 신규 모델, 경쟁사 Codex의 시장 점유율을 끌어올렸을까?
Anthropic의 신규 모델 Fable이 데이터 30일 저장 및 상업적 위협 시 성능 저하(nerfing) 정책으로 인해 사용자 이탈 가능성을 높이고 있습니다. 이와 함께 스마트 모델 라우팅 트렌드, Coinbase의 인프라 장애 사례, 그리고 OpenAI와 Anthropic의 IPO 추진 소식 등 빅테크 산업의 주요 변화를 다룹니다.
The Pulse: Did Anthropic’s new model just boost rival Codex’s market share?↗newsletter.pragmaticengineer.com
- 79
OpenAI, 사무직 업무용 새로운 Codex 툴 출시
OpenAI는 데이터 분석, 영업, 금융 등 특정 직무에 특화된 6종의 새로운 Codex 플러그인을 출시하며 지식 노동자 시장 공략에 나섰습니다. 이번 업데이트에는 작업물을 웹사이트로 변환하는 'Sites' 기능과 정밀한 명령을 지원하는 'Annotations' 기능이 포함되어, AI의 업무 활용 범위를 단순 텍스트 생성을 넘어 실질적인 워크플로우 통합 단계로 격상시켰습니다.
OpenAI launches new Codex tools for white-collar work↗techcrunch.com












