slowlp
← loop
교훈 2026.07.20 · 7분 읽기

Qwen 3.8 오픈웨이트 도전, Kimi K3 프론트엔드 1위, 엑스레이 AI 과신

오늘의 AI 핵심 뉴스 — 2026-07-20

LOOP

📰 뉴스

  • 알리바바 Qwen 3.8, “Fable 5 다음” 오픈웨이트 카드 — 2.4T 파라미터, 코딩·생산성·1T+ 멀티모달 강조. 벤치는 아직 비공개. Kimi K3 모멘텀을 흔들려는 타이밍. 웨이트는 “곧”. → The Decoder

  • Kimi K3, 프론트엔드 선호도 1위… 고난도 수학은 39% — Code Arena Frontend에서 Fable 5·GPT-5.6 Sol을 제치고 중국 모델 첫 정상. FrontierMath Tier 4는 ~39%, 서구 프론티어는 ~90%대. “이겼다”는 헤드라인 뒤에 영역 편차가 큼. → The Decoder

  • DeepMind: 비디오 생성기가 이미 월드 모델 — GenCeption이 사전학습 비디오 모델을 깊이·세그멘테이션 등 CV 작업에 재사용. 합성 영상 소량으로 한 번의 forward pass. “생성 모델 = 보편 월드 모델” 논쟁에 연료. → The Decoder

  • 엑스레이 챗봇, 틀려도 자신감 만땅 — RadLE 2.0: 정답+확신+“모르겠다”를 같이 점수화. 인간은 988/2000, 최고 AI 758. Fable 5는 안전 응답 선두, Gemini 3 Pro는 순수 정확도 최고. 과신이 임상 리스크. → The Decoder

  • AI 탐지기, 문체 흉내 내면 구멍 뚫림 — Epoch AI: 평범 생성문은 거의 잡히지만 특정 작가 스타일 모사 시 평균 13% 미탐, 과학 글은 24~29%. 교육·학술 게이트로 쓰기엔 약함. → The Decoder

  • Apple 소송이 OpenAI 하드웨어 시계를 건드린다 — 영업비밀 소송이 스마트 스피커 등 디바이스 로드맵·상장 일정에 지연 압력. OpenAI는 “근거 없다” 반박. → TechCrunch

  • Vertu, 임원용 AI 에이전트 폰 $6,880 — Alphafold + Hermes Agent(오픈소스 Hermes 기반). 가죽·티타늄 럭셔리, 하드웨어는 ZTE/Nubia 계열 파트너십 정황. 스펙이 아니라 “하루 업무를 대신 돌리나”가 핵심. → TechCrunch

  • 모델 라우팅, 가격표만 보면 진다 — IBM Research: 에이전트 워크로드에선 캐시 히트가 실비용. 같은 태스크에 Sonnet이 GPT-4.1보다 싸게 나온 사례. 난이도 분류만으로 라우팅하면 깨짐. → HF


🔥 GitHub 트렌딩

  • Robbyant/lingbot-map — 스트리밍 3D 재구성 파운데이션 모델. ~20 FPS, 1만+ 프레임 장시퀀스.

  • lyogavin/airllm — 양자화 없이 70B를 4GB GPU에서. DeepSeek-V3급도 저메모리 추론 주장.

  • tirth8205/code-review-graph — Tree-sitter 기반 코드 그래프 + MCP. 리뷰 시 토큰 낭비를 줄이는 로컬 인텔리전스.

  • rohitg00/ai-engineering-from-scratch — 503레슨·20페이즈 오픈 커리큘럼. 매 레슨이 프롬프트·스킬·에이전트·MCP 산출물.

  • ibelick/ui-skills — 디자인 엔지니어용 에이전트 스킬 세트. npx ui-skills start로 작업별 라우팅.


▶️ YouTube

  • Did Kimi K3 really beat Fable? — Matthew Berman | 벤치 헤드라인 뒤 “진짜로 이긴 건가” 재점검. 프론트엔드 선호 vs 수학 격차와 같이 보면 좋음.

💬 커뮤니티

댓글