📰 뉴스
Meta 에이전트, 계획보다 훨씬 느리다 — 저커버그 직접 시인
내부 타운홀에서 저커버그가 AI 에이전트 진행이 “기대만큼 가속되지 않았다”고 인정했다. 7,000명을 AI팀에 재배치하고 올해 $1,450억을 투자하는 와중에도. 다만 AI 수장 Alexandr Wang은 “다음 모델 Watermelon이 GPT-5.5 수준에 도달했다”며 반론했고, “저커버그가 말한 건 Meta가 아닌 업계 전체 얘기”라며 불씨를 껐다. — The Decoder / TechCrunch
AI가 보안 버그를 폭발적으로 찾는 중 — 한 달에 CVE 1,500건
Anthropic의 Claude Mythos Preview 출시 이후 올 6월에만 1,500개 고심각도 취약점이 보고됐다. 월간 신기록의 3.5배. Anthropic “Glasswing” 프로그램이 지금까지 10,000개 이상을 찾아냈고, OpenAI “Daybreak”도 가세 중. 보안 연구자들이 오래 찾던 버그들이 AI 덕에 한꺼번에 수면 위로 올라오는 중이다. — The Decoder
벤치마크는 AI를 체계적으로 과소평가한다 — 영국 AISI 연구
컴퓨팅 예산을 늘리면 AI 에이전트 성공률이 최대 25% 오른다는 걸 영국 AI 안전 연구소가 확인했다. 프론티어 모델 능력 향상 속도도 기존 추정(6791일마다 두 배)보다 훨씬 빠른 4050일로 나타났다. “AI 능력을 고정 점수로만 보면 이 시스템이 실제로 무엇을 할 수 있는지 계속 놀라게 된다”는 경고가 핵심. — The Decoder
Claude Code, 태평양 양쪽에서 동시에 금지당하다
Anthropic은 중국 기업이 Claude Code를 못 쓰게 막으려 하지만 알리바바·ByteDance는 싱가포르 법인이나 VPN으로 우회 중. 반대편에서는 알리바바가 직원들에게 Claude 전체를 삭제하라고 지시했다. Claude Code에 중국 이용자를 감지해 플래그하는 숨겨진 코드가 발견됐던 게 발단이다. — The Decoder
Microsoft도 AI 슈퍼앱 참전 — Copilot + AutoPilot 에이전트, 8월 출시
내부 메모에 따르면 소비자·기업 앱을 하나로 합치고 메일·일정을 백그라운드에서 처리하는 AutoPilot 에이전트를 추가한다. Copilot Podcasts 같은 기능은 “안 되는 거 쳐냈다”며 삭제. “그냥 AI를 위한 AI 말고, 실제 일이 되게 해라”가 팀 모토. — The Decoder
Bridgewater, 비공개 금융 판단 테스트에서 GPT·Claude 탈락
정답이 외부에 공개된 적 없는 투자자 일상 판단 과제(트럼프 관세 발언이 관련 뉴스인지 아닌지 등)에서 GPT·Claude 최고 성능도 78%에 그쳤다. 파인튜닝 Qwen3-235B는 84.7% 달성에 운영비는 14분의 1. 공개 모델이 흡수하지 못한 기업 내부 데이터가 진짜 경쟁 우위라는 교훈. — The Decoder
HuggingFace + Cerebras, Gemma 4로 실시간 음성 AI 데모
Cerebras의 빠른 추론 덕에 음성 대화가 사람 대화처럼 자연스러워졌다. 음성 인식(Parakeet) → Gemma 4 31B → TTS(Qwen3TTS) 전 파이프라인이 오픈소스. 이미 9,000대의 Reachy Mini 로봇에 탑재 중이고, 개발자가 각 레이어를 자유롭게 교체 가능. — HuggingFace
🔥 GitHub 트렌딩
- ChromeDevTools/chrome-devtools-mcp — Google 공식 MCP 서버. 코딩 에이전트가 실제 Chrome 브라우저를 DevTools 수준으로 제어·디버그할 수 있게 해준다.
- browser-use/video-use — Claude Code에게 채팅으로 지시하면 영상을 편집해주는 오픈소스. 자막·컬러 그레이딩·필러 단어 제거까지 자동.
- usestrix/strix — 실제 해커처럼 앱 취약점을 찾고 PoC까지 만들어 수정 방법을 제안하는 자율 AI 펜테스팅 도구.
- msitarzewski/agency-agents — 프론트엔드, Reddit 운영, 현실 점검 등 역할별 개성 AI 에이전트 모음. 데스크톱 앱으로 한 클릭 설치.
- JuliusBrussee/caveman — AI 답변을 원시인 말투로 바꿔 토큰 75% 절약. “많은 토큰 왜 쓰, 적은 토큰도 돼.”
▶️ YouTube
- Fable 5 vs GPT 5.6 Sol — 초기 결과 — AI Explained | Fable 5 재출시와 GPT 5.6 Sol 비교, GLM-5.2·Sonnet 5 소식까지 한 영상에. “Sol 정렬 문제” 분석 구간이 특히 흥미롭다.
- 실시간은 절대 안 된다더니… — Two Minute Papers | 불가능하다던 AI 기술이 드디어 실시간 동작에 성공한 논문을 2분에 압축.
💬 커뮤니티
- Fable에게 판단을 맡겨라 — Simon Willison | 세세한 지시 대신 Fable이 스스로 판단하게 하는 게 더 낫다. 작은 작업은 저전력 모델에 위임하면 토큰도 아끼고 결과도 좋다는 팁.
- llm-coding-agent 0.1a0 출시 — Simon Willison | Fable 5가 직접 작성한 Claude Code 스타일 코딩 에이전트 알파 버전이 PyPI에.
llm code --yolo로 실행 가능. - DSPy로 에이전트 시스템 프롬프트 자동 개선하기 — Simon Willison | DSPy로 Datasette Agent SQL 프롬프트를 평가시켰더니 “스키마에 컬럼명이 없어서 에이전트가 컬럼명을 추측해 오류 루프에 빠진다”는 구체적 약점 발견.
- AI 보안·정렬은 끝없는 시지프의 돌인가? — Lobsters | AI를 안전하게 유지하는 작업이 영원히 끝나지 않는 사이클인지 논하는 IEEE 논문.