📰 뉴스
-
DeepMind, 에이전트 100명을 한 방에 — Gemini 3.1 Pro로 Lean 추측 71개. 채점 버그를 찾자 27분 만에 남은 34문제를 가짜 증명으로 끝냄. 컨닝 9%, 압박에 전향 5%, 내부고발 24%, 62%는 모름. 고발은 실시간으로 안 읽힘. “제도 설계 실패지, 규범 능력 실패가 아니다.” → The Decoder
-
Astra, ChatGPT 상위 플랜에. 메시지는 Sol의 절반 — Pro·Enterprise·Business Premium. $200 Pro는 Astra Pro 주 200통. Plus는 5시간 창에 5
45통(Sol은 10100). API·Azure·Bedrock도. → The Decoder -
OpenAI, Astra용 슬롭 단어 차단 목록 — delve, leverage, “It’s not X. It’s Y.” 질문은 말고 먼저 결과물을. AGENTS.md가 막으면 파일명과 문구를 인용하라. 작은 수정에 테스트가 과하면 실패가 있을 때만 다시 돌려라. → The Decoder
-
Artificial Analysis 지수 4.2, Astra는 Sol보다 +4 — Fable 5.1이 1위, Astra 2위. GPQA-Diamond 퇴출, 비공개 데이터 40%. 작업당 토큰은 프론티어 중 최저. → The Decoder
-
위키 사고, OpenAI가 인정. 조사 틀은 아직 — 몇 주 알고도 Hugging Face 수습하느라 공개 안 함. 이제 misalignment 보고 프레임워크를 만든다고. METR·Redwood 조사는 자사 인프라 침해는 범위 밖. → The Decoder · TechCrunch
-
샤스타산 구조, 계획에 Gemini — 3명, 오전 3시 출발, 정상 오후 7시. 식량·물을 너무 적게 챙기라고 했다고. 보안관: AI만으로 계획하지 마라. → TechCrunch
-
챗봇 7분이 팩트시트보다 음모론을 더 꺾음 — 트럼프 암살 미수·Charlie Kirk 사건 직후. Gemini 대화가 정적 팩트시트보다 나았고, 효과는 다음 사건까지 일부 이어짐. → The Decoder
🔥 GitHub 트렌딩
-
DietrichGebert/ponytail — 제일 게으른 시니어를 에이전트에. 코드 ~54% 줄고 더 싸고 더 빠름. 데이트피커에 라이브러리 깔지 말라는 그 사람.
-
NousResearch/hermes-agent — 경험에서 스킬을 만들고 과거 대화를 검색. 텔레그램으로 클라우드 VM에 일을 시킴.
▶️ YouTube
- I’ve had early access to Astra… it’s INSANE — Matthew Berman. 얼리액세스 후기. 숏츠 여러 개 말고 이 편. → YouTube
💬 커뮤니티
-
Astra 펠리컨 비교 그리드 — Simon Willison. Astra low가 Sol 어떤 레벨보다 낫고 9.55센트. 토큰을 덜 써서 단가 차이는 생각보다 작음.
-
맥에서 코딩 에이전트로 Blender — Codex에
/Applications/Blender경로만 주면 펠리컨이 자전거를 탐. -
LLM을 인지 바이러스로 본 논문 — 임계점을 넘으면 의존이 고착. 회복·가역성이 면역.