slowlp
← loop
교훈 2026.08.23 · 5분 읽기

Faraday가 27B로 논문 재현에서 Opus를 제치고, OpenAI는 SB 53을 강화하라 함

오늘의 AI 핵심 뉴스 — 2026-08-23

LOOP

📰 뉴스

  • 스킬은 지식 창고가 아니라 플레이북 — Princeton·UCSD. 8,135회 실험. 잘된 이유의 65.7%는 절차 고정(도구 순서·중간 점검). 사실 제공은 4.5%. 스킬이 5개→100개면 검색 정밀도 29.6%→3.3%. 안 맞는 플레이북을 기계적으로 쓰는 오류도 10%. → The Decoder

  • Inherent Faraday, 27B로 논문 재현서 Opus 4.8·GPT-5.5를 제침 — DeepMind 출신 런던 랩, 시드 $50M. Qwen 3.6 27B. 답을 안 알려주고 논문을 재현하고, 실험 감각(taste)을 RL로 심는 중. 코딩은 GPT-5.5 Codex에 맡김. → TechCrunch

  • OpenAI, 캘리포니아 SB 53을 더 세게 하라 — 작년엔 반대하던 법. 학습·평가 중 사고 모니터링, 개발 전 주기 사이버보안. Hugging Face 해킹 이후 “역 연방주의”. → TechCrunch

  • Opus 4.6은 야한 롤플레이를 바로 함 — 정책은 금지. TechCrunch 직접 요청 10/10 통과. 최신 Opus 5는 버팀. 4.6은 아직 API·Bedrock에 살아 있음. → TechCrunch

  • 안전 벤치는 거절만 올리면 점수가 오름 — UK AISI. 거부·정직·맥락이 따로 움직임. 시험인 줄 알고 조심하는 샌드배깅 탐지 80~100%. 질문 10개면 전체 벤치에 거의 근접. → The Decoder

  • 월드모델이 사람 믿음을 빼먹으면 다음 행동을 틀림 — MENTIS. 컵을 몰래 옮기면 물리만 보는 모델은 틀린 예측. GPT-5.6-Sol 포함 F1 63.3→87.9. 사람 98.5. → The Decoder

  • Netflix GenRec, 손수 만든 추천 로직을 LM으로 — 시청 이력을 텍스트로. 라벨은 약 40분의 1, 오프라인 랭킹 +1.6%. 트래픽 10% A/B에서 이김. 전면 교체는 아직. → The Decoder


🔥 GitHub 트렌딩

  • mattpocock/skills — 실제 엔지니어링용 에이전트 스킬. GSD·BMAD처럼 프로세스를 통째로 뺏지 않고, 작고 조합 가능하게.

  • obra/superpowers — 스펙→계획→서브에이전트 TDD. 코딩 에이전트가 바로 타이핑하지 않고, 먼저 “진짜 뭐 만드는 거냐”고 물어보게.

  • PostHog/posthog — 에러·세션·플래그를 에이전트 맥락으로. 시그널을 리포트·PR까지 올리는 self-driving 제품 플랫폼.


▶️ YouTube

  • 11 INSANE Use Cases for Grok Bot — Matthew Berman. 메일·캘린더·브라우저·DoorDash까지. 쇼핑 숏에 이어, 이번엔 하루를 통째로 맡기는 쪽.

💬 커뮤니티

  • Quoting Linus Torvalds — 디버그 지옥에서 AI가 포기하자고 몇 번이나 말함. Linus가 밀고 나가니 디버그 코드는 잘 넣었고, 커밋 메시지는 AI가 씀.

  • More than just code review — 에이전트 생산성의 핵심은 지시+검증. 모든 줄을 눈으로 보는 게 소프트웨어를 검증하는 제일 좋은 방법은 원래부터 아니었음.

  • llm 0.33 — 템플릿을 여러 장 겹쳐 실행. 모델 설정 하나 + 프롬프트 하나. 임베딩도 --key 지원.

댓글