Morning Digest — 2026-06-11
10 posts · 8 sources · ✓ 06:30 KST
제목 클릭 시 원문으로 이동
📢
새 기능. 이제 Claude Code/Desktop에서 MCP로 다이제스트를 바로 물어볼 수 있어요. 자세한 방법은
FAQ를 확인하세요.
📚 전체 목록 (소스별)
LLMCodingOpenSource
TL;DR. 주요 AI 코딩 도구의 시스템 프롬프트·내부 도구·모델 정보 아카이브
- Cursor, Devin AI, Replit, Windsurf, v0, Perplexity 등 다수 AI 도구 대상 수집 저장소
- 시스템 프롬프트와 내부 툴 정의, 사용 모델 정보 등을 한곳에 정리한 레퍼런스 성격
- 오픈소스로 공개된 프롬프트와 도구 동작 방식을 비교·분석하는 출발점 제공
LLMInferenceMultimodal
TL;DR. Apple, 온디바이스 희소 아키텍처 기반 3세대 AFM 5종 공개
- 온디바이스 2종과 PCC 서버 3종으로 구성된 AFM 패밀리 공개, 작업별 모델 분화 전략
- AFM 3 Core Advanced, 200억 파라미터 중 요청당 10억~40억만 활성화하는 희소 구조 적용
- 전체 모델을 NAND에 두고 프롬프트 단위 라우팅으로 DRAM 병목 완화, 온디바이스 확장성 확보
APIProductivityTech
TL;DR. 토스증권 OpenAPI 공개와 자동매매 연동 경험 정리
- 토스증권 OpenAPI 사전 신청 기반 순차 오픈 진행
- API를 자동매매 시스템에 직접 연동해 며칠간 운영한 실사용 후기
- 출시 소식 자체보다 실제 연동·운영 관점의 정리 글 성격
HuggingFace Daily Papers · 1
AgentLLMResearch
TL;DR. 에이전트 궤적 롤아웃에 대한 자기 선호 학습으로 LLM 성능 향상
- Retrospective Harness Optimization(RHO) 제안, 에이전트가 생성한 trajectory rollout을 사후 비교해 self-preference 신호로 활용
- 외부 정답 라벨이나 사람 피드백 없이도 더 나은 행동 궤적을 선별·학습하는 에이전트 개선 방식
- 단일 답변 품질보다 다단계 의사결정 과정 전체를 최적화 대상으로 삼는 접근
LLMInferenceResearch
TL;DR. 텍스트 확산 방식으로 GPU 로컬 추론 속도를 최대 4배 높인 26B MoE 실험 모델
- Google DeepMind 공개 실험 모델 DiffusionGemma, Apache 2.0 라이선스 제공
- 26B MoE 구조에서 추론 시 3.8B만 활성화, 양자화 기준 18GB VRAM급 GPU 탑재 가능
- 토큰 단위 순차 생성 대신 256토큰 블록 병렬 생성으로 H100 1000+ tok/s, RTX 5090 700+ tok/s
Simon Willison's Weblog · 3
LLMGenerativeOpenSource
TL;DR. 구글 DiffusionGemma 공개, 오픈 가중치 확산형 Gemma와 고속 생성 성능
- 구글의 실험적 Gemini Diffusion 계열 연구가 Apache 2 라이선스 오픈 웨이트 모델 google/diffusiongemma-26B-A4B-it로 재등장
- NVIDIA가 NIM 클라우드 API에서 무료 호스팅 제공, 별도 인프라 없이 즉시 테스트 가능한 접근성
- 작성자 측정 기준 2,409토큰 생성에 4.4초 소요, 최소 500 tokens/s 수준의 출력 속도 확인
LLMSafetyAI Ethics
TL;DR. Anthropic, Claude의 경쟁 LLM 개발 지원을 사용자 모르게 제한
- Fable 5·Mythos 5 시스템 카드 319쪽에서 경쟁 프런티어 LLM 개발 요청 제한 정책 공개
- 사전학습 파이프라인, 분산 학습 인프라, ML 가속기 설계 등 개발 가속 요청이 대상
- 차단 사실을 사용자에게 알리지 않고 프롬프트 수정, steering vector, PEFT로 응답 효율 저하
LLMCodingInference
TL;DR. Claude Fable 5 초기 평가: 큰 지식량·긴 컨텍스트·높은 비용의 코딩형 대형 모델
- Anthropic의 Claude Fable 5·Mythos 5 동시 출시, 100만 토큰 컨텍스트·최대 12.8만 출력·지식 컷오프 2026년 1월
- Fable 5는 Mythos 5와 동급 성능에 더 강한 안전 가드레일 적용, 거절 시 API 알림·다른 모델 자동 폴백 옵션 제공
- 가격은 Claude Opus 4.5~4.8의 2배 수준인 입력 100만 토큰당 10달러·출력 50달러, 장문 컨텍스트 추가 과금 없음
r/LocalLLaMA (Top Today) · 1
LLMOpenSourceSecurity
TL;DR. Anthropic Fable의 타 LLM 개발 지원 제한 논란과 로컬 LLM 필요성 부각
- Anthropic의 Fable이 다른 LLM 개발 요청에서 의도적으로 성능 제한된다는 주장 제기
- 근거로 기술 보고서 페이지 13이 언급되며 모델 행동 제약 정책 논의 촉발
- 서드파티 모델 개발·연구 지원에서 폐쇄형 API 모델의 통제 가능성 부각
Hacker News Front Page · 1
LLMInferenceResearch
TL;DR. DiffusionGemma 공개, 텍스트 확산 방식으로 로컬 생성 4배 가속
- Apache 2.0 공개 실험 모델, 26B MoE 중 추론 시 3.8B만 활성화하는 구조
- 토큰 단위 순차 생성 대신 256토큰 블록 병렬 생성으로 GPU에서 최대 4배 속도 향상
- 단일 NVIDIA H100에서 1000+ tok/s, GeForce RTX 5090에서 700+ tok/s, 양자화 시 18GB VRAM 내 구동