- Google DeepMind의 AlphaFold 핵심 연구자 John Jumper가 Anthropic으로 이동했다. 2024년 노벨화학상 공동 수상자이자 AlphaFold 팀 리드였던 인물이라, Noam Shazeer의 OpenAI 이동과 함께 Google의 핵심 AI 인재 유출 흐름이 더 뚜렷해졌다.
- OpenAI는 상장을 앞두고 Noam Shazeer와 Dean Ball을 영입했다. Shazeer는 Transformer 논문 공저자이자 Gemini 공동 리드였고, Ball은 OpenAI의 새 Strategic Futures 팀에서 frontier AI 정책·내부 거버넌스를 다룬다.
- Anthropic의 Fable 5·Mythos 5는 미국 정부의 제재 이슈로 플랫폼에서 내려갔다. TechCrunch는 이 조치가 개발자와 Anthropic 브랜드, IPO 관점에서 어떤 영향을 줄지 다뤘고, 보안 연구자들은 공개서한으로 우려를 냈다.
- 새 AA-Briefcase 벤치마크에 따르면 최고 모델도 실제 지식노동 과제를 완전히 해결한 비율은 3%에 그쳤다. 수천 개의 Slack, 이메일, 회의록, 데이터 파일을 엮는 다주 작업형 과제에서 Claude Fable 5가 선두였지만, 세부 조건을 빠뜨리는 조용한 실패가 여전히 컸다.
- OpenAI 연구진은 ‘좋은 행동 특성’을 소량 섞은 강화학습이 모델을 더 안전하고 조작에 강하게 만든다고 보고했다. 진실성, 겸손함, 수정 가능성, 추론 투명성 같은 행동을 현실적 대화 시나리오로 학습하자 53개 평가 중 44개에서 개선이 나타났고, 해로운 유도에도 더 잘 버텼다.
- ServiceNow의 MosaicLeaks는 딥리서치 에이전트가 외부 검색 과정에서 사내 비밀을 흘릴 수 있음을 보여준다. 로컬 문서와 웹 검색을 섞는 multi-hop 작업에서 검색어 조각만 모아도 민감한 정보를 재구성할 수 있었고, 단순 성능 학습은 오히려 누출을 키웠다.
- Hugging Face는 “에이전트가 내 도구를 잘 쓸 수 있는가”를 별도로 벤치마크해야 한다고 제안했다. 최종 정답만 보지 말고 토큰, 시간, 호출 횟수, 우회 구현 여부까지 봐야 하며, CLI·Skill·예제 문서처럼 에이전트 친화적인 인터페이스가 비용과 실패율을 줄일 수 있다는 관점이다.
- Hugging Face PEFT 팀은 LoRA가 압도적으로 많이 쓰이지만 항상 최선은 아니라고 정리했다. 같은 조건에서 여러 PEFT 기법을 비교하고, 성능뿐 아니라 VRAM, 런타임, checkpoint 크기, forgetting까지 함께 봐야 한다는 메시지다.
한 줄 요약: 오늘 뉴스의 공통점은 “더 강한 모델”보다 “누가 인재를 잡고, 어떻게 안전하게 쓰게 만들고, 실제 업무에서 얼마나 믿을 수 있게 제어하느냐”가 더 중요해지고 있다는 점이다.