📰 뉴스
-
알리바바 Qwen 3.8, “Fable 5 다음” 오픈웨이트 카드 — 2.4T 파라미터, 코딩·생산성·1T+ 멀티모달 강조. 벤치는 아직 비공개. Kimi K3 모멘텀을 흔들려는 타이밍. 웨이트는 “곧”. → The Decoder
-
Kimi K3, 프론트엔드 선호도 1위… 고난도 수학은 39% — Code Arena Frontend에서 Fable 5·GPT-5.6 Sol을 제치고 중국 모델 첫 정상. FrontierMath Tier 4는 ~39%, 서구 프론티어는 ~90%대. “이겼다”는 헤드라인 뒤에 영역 편차가 큼. → The Decoder
-
DeepMind: 비디오 생성기가 이미 월드 모델 — GenCeption이 사전학습 비디오 모델을 깊이·세그멘테이션 등 CV 작업에 재사용. 합성 영상 소량으로 한 번의 forward pass. “생성 모델 = 보편 월드 모델” 논쟁에 연료. → The Decoder
-
엑스레이 챗봇, 틀려도 자신감 만땅 — RadLE 2.0: 정답+확신+“모르겠다”를 같이 점수화. 인간은 988/2000, 최고 AI 758. Fable 5는 안전 응답 선두, Gemini 3 Pro는 순수 정확도 최고. 과신이 임상 리스크. → The Decoder
-
AI 탐지기, 문체 흉내 내면 구멍 뚫림 — Epoch AI: 평범 생성문은 거의 잡히지만 특정 작가 스타일 모사 시 평균 13% 미탐, 과학 글은 24~29%. 교육·학술 게이트로 쓰기엔 약함. → The Decoder
-
Apple 소송이 OpenAI 하드웨어 시계를 건드린다 — 영업비밀 소송이 스마트 스피커 등 디바이스 로드맵·상장 일정에 지연 압력. OpenAI는 “근거 없다” 반박. → TechCrunch
-
Vertu, 임원용 AI 에이전트 폰 $6,880 — Alphafold + Hermes Agent(오픈소스 Hermes 기반). 가죽·티타늄 럭셔리, 하드웨어는 ZTE/Nubia 계열 파트너십 정황. 스펙이 아니라 “하루 업무를 대신 돌리나”가 핵심. → TechCrunch
-
모델 라우팅, 가격표만 보면 진다 — IBM Research: 에이전트 워크로드에선 캐시 히트가 실비용. 같은 태스크에 Sonnet이 GPT-4.1보다 싸게 나온 사례. 난이도 분류만으로 라우팅하면 깨짐. → HF
🔥 GitHub 트렌딩
-
Robbyant/lingbot-map — 스트리밍 3D 재구성 파운데이션 모델. ~20 FPS, 1만+ 프레임 장시퀀스.
-
lyogavin/airllm — 양자화 없이 70B를 4GB GPU에서. DeepSeek-V3급도 저메모리 추론 주장.
-
tirth8205/code-review-graph — Tree-sitter 기반 코드 그래프 + MCP. 리뷰 시 토큰 낭비를 줄이는 로컬 인텔리전스.
-
rohitg00/ai-engineering-from-scratch — 503레슨·20페이즈 오픈 커리큘럼. 매 레슨이 프롬프트·스킬·에이전트·MCP 산출물.
-
ibelick/ui-skills — 디자인 엔지니어용 에이전트 스킬 세트.
npx ui-skills start로 작업별 라우팅.
▶️ YouTube
- Did Kimi K3 really beat Fable? — Matthew Berman | 벤치 헤드라인 뒤 “진짜로 이긴 건가” 재점검. 프론트엔드 선호 vs 수학 격차와 같이 보면 좋음.
💬 커뮤니티
-
AI 매니아가 의사결정을 잡아먹는다 — ChatGPT도 안 써본 임원이 $2B 조직 AI 전략을 쓰고, 벤더는 “100x”를 부정하면 계약이 날아갈까 봐 입을 다문다는 일화 모음.
-
Claude Code, 이제 Rust로 포팅된 Bun — v2.1.181+가 Bun canary(Rust)를 실어 수백만 디바이스에. “Boring is good.”
-
투석기로 인간형 신경망 — Gwern 쪽 “catapulting” 프레임. 스케일·학습 역학 토론 소재.
-
Pangram은 어떻게 작동하나 — 오늘 Epoch 탐지기 연구와 짝으로 읽기 좋은 탐지 쪽 해설.
-
Alibaba SAIL용 Triton — 알리바바 칩/런타임 쪽 Triton 포크. 오픈웨이트 경쟁의 인프라 레이어.