← 아카이브 목록
 TH—NEWS

Morning Digest — 2026-06-04

10 posts · 8 sources · ✓ 06:30 KST
제목 클릭 시 원문으로 이동
📢 새 기능. 이제 Claude Code/Desktop에서 MCP로 다이제스트를 바로 물어볼 수 있어요. 자세한 방법은 FAQ를 확인하세요.
👀 관심 있으면 볼 것
LLM/Agent
소스 제목 한줄 요약
GitHub microsoft/markitdown 문서·미디어를 LLM 친화적 Markdown으로 바꾸는 경량 파이썬 도구
PyTorch KR JetBrains, AI 워크플로를 위한 오픈소스 MoE 모델 Mellum 2 공개 어제 JetBrains, 12B 오픈소스 MoE Mellum 2로 저지연 AI 워크플로 공략
GeekNews OpenAI, Codex에서 웹사이트를 만들어 배포하는 Sites 플러그인 공개 어제 Codex에서 프롬프트만으로 웹사이트 생성·호스팅·배포하는 Sites 플러그인 공개
HF Papers KVarN: Variance-Normalized KV-Cache Quantization Mitigates Error Accu… 추론 작업의 오차 누적을 줄이는 분산 정규화 KV-캐시 양자화 기법
HF Papers NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop A… 폐루프 자율주행 시뮬레이션용 실시간 생성형 월드 모델 OmniDreams 제안
AI Lab Blogs Introducing new capabilities to GPT-Rosalind 어제 GPT-Rosalind의 생명과학 추론·유전체 분석·실험 워크플로 역량 확장
Simon Willison's Weblog Uber Caps Usage of AI Tools Like Claude Code to Manage Costs 어제 우버, AI 코딩 도구별 월 1,500달러 토큰 한도 도입
r/LocalLLaMA (Top Today) google/gemma-4-12B · Hugging Face Google Gemma 4 12B 공개, 멀티모달·256K 컨텍스트·140개 언어 지원
Hacker News Front Page Gemma 4 12B: A unified, encoder-free multimodal model Gemma 4 12B 공개, 인코더 없는 통합 멀티모달 모델 설계
Research
소스 제목 한줄 요약
PyTorch KR NVIDIA Cosmos 3: 물리 추론과 월드 생성, 행동 생성을 하나로 통합한 피지컬 AI 오픈 모델 어제 NVIDIA Cosmos 3의 물리 추론·월드 생성·행동 생성을 통합한 피지컬 AI 오픈 모델 공개
📚 전체 목록 (소스별)
GitHub Trending · 1
https://github.com/trending
microsoft/markitdown Python · 2,006 stars today · ⭐ 142,797
LLMToolingOpenSource
TL;DR. 문서·미디어를 LLM 친화적 Markdown으로 바꾸는 경량 파이썬 도구
  • PDF·Word·Excel·PowerPoint·HTML·CSV·JSON·XML·EPub·ZIP·YouTube URL까지 Markdown 변환 지원
  • 제목·목록·표·링크 등 문서 구조 보존에 초점, textract 유사하되 LLM·텍스트 분석 파이프라인 지향
  • 이미지 EXIF·OCR, 오디오 메타데이터·음성 전사 지원, Azure Content Understanding 연동으로 구조화 필드 추출 가능
PyTorch KR 읽을거리 · 2
https://discuss.pytorch.kr/c/news/14
JetBrains, AI 워크플로를 위한 오픈소스 MoE 모델 Mellum 2 공개 어제
LLMInferenceOpenSource
TL;DR. JetBrains, 12B 오픈소스 MoE Mellum 2로 저지연 AI 워크플로 공략
  • Apache 2.0 공개 12B 모델, 코드·자연어 특화 및 처음부터 자체 학습된 소프트웨어 엔지니어링용 범용 LLM
  • 64개 전문가 중 토큰당 8개만 활성화하는 MoE로 활성 파라미터 2.5B 수준, 지연 시간·처리량·비용 최적화
  • GQA와 슬라이딩 윈도우 어텐션, YaRN 기반 128K 컨텍스트, MTP 헤드 기반 추측 디코딩으로 추론 효율 강화
NVIDIA Cosmos 3: 물리 추론과 월드 생성, 행동 생성을 하나로 통합한 피지컬 AI 오픈 모델 어제
RoboticsMultimodalResearch
TL;DR. NVIDIA Cosmos 3의 물리 추론·월드 생성·행동 생성을 통합한 피지컬 AI 오픈 모델 공개
  • 물리 추론, 월드 생성, 행동 생성을 단일 모델 계열로 묶은 피지컬 AI 지향 구조
  • NVIDIA가 Cosmos 3를 오픈 모델로 공개한 소식 중심의 발표
  • 로보틱스·시뮬레이션·에이전트 환경처럼 물리 세계 이해와 상호작용이 필요한 활용 맥락
GeekNews 최신 · 1
https://news.hada.io/new
OpenAI, Codex에서 웹사이트를 만들어 배포하는 Sites 플러그인 공개 어제
CodingToolingGenerative
TL;DR. Codex에서 프롬프트만으로 웹사이트 생성·호스팅·배포하는 Sites 플러그인 공개
  • Codex 프롬프트나 프로젝트에서 OpenAI 호스팅 웹사이트 직접 제작·배포 지원
  • 별도 배포 파이프라인 없이 웹사이트, 웹 앱, 게임까지 생성 가능한 워크플로 제공
  • 개발 환경과 배포 환경을 한 흐름으로 묶어 프로토타이핑과 공유 과정 단순화
HuggingFace Daily Papers · 2
https://huggingface.co/papers
KVarN: Variance-Normalized KV-Cache Quantization Mitigates Error Accumulation in Reasoning Tasks arXiv
LLMInferenceResearch
TL;DR. 추론 작업의 오차 누적을 줄이는 분산 정규화 KV-캐시 양자화 기법
  • KV-cache quantization에서 reasoning 단계가 길어질수록 커지는 오차 누적 문제를 겨냥한 KVarN 제안
  • 키·값 분포의 분산을 정규화한 뒤 양자화하는 방식으로 캐시 압축과 정확도 저하 완화를 함께 추구
  • 특히 다단계 추론(reasoning) 과제에서 기존 KV-cache 양자화 대비 안정적인 성능 유지를 목표로 한 접근
NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation arXiv
GenerativeRoboticsResearch
TL;DR. 폐루프 자율주행 시뮬레이션용 실시간 생성형 월드 모델 OmniDreams 제안
  • NVIDIA가 제안한 OmniDreams로 폐루프(closed-loop) 자율주행 시뮬레이션용 생성형 월드 모델 지향
  • 실시간(real-time) 생성 성능을 전면에 둔 세계 모델로 차량 시뮬레이션 루프 내 직접 활용 목적
  • 자율주행 시뮬레이션에서 환경 생성과 에이전트 상호작용을 통합하는 방식의 연구 포지셔닝
AI Lab Blogs · 1
https://openai.com/news
Introducing new capabilities to GPT-Rosalind 어제
LLMResearchBio
TL;DR. GPT-Rosalind의 생명과학 추론·유전체 분석·실험 워크플로 역량 확장
  • 생명과학 연구용 GPT-Rosalind의 신규 기능 공개, biological reasoning 강화 중심
  • 의약화학(medicinal chemistry) 전문성 확장, 후보 물질 탐색·해석 지원 범위 확대
  • 유전체(genomics) 분석 역량 추가, 생물학 데이터 해석과 연구 인사이트 도출 지원
Simon Willison's Weblog · 1
https://simonwillison.net/
Uber Caps Usage of AI Tools Like Claude Code to Manage Costs 어제
LLMCodingProductivity
TL;DR. 우버, AI 코딩 도구별 월 1,500달러 토큰 한도 도입
  • 우버, Cursor·Claude Code 같은 에이전트형 코딩 도구에 직원당 도구별 월 1,500달러 상한 적용
  • 한 도구의 사용액이 다른 도구 예산에 영향 없는 구조로, 도구별 개별 캡 방식 채택
  • 작성자 추산 기준 엔지니어가 도구 2개를 적극 사용하면 연간 최대 3만6천달러 수준
r/LocalLLaMA (Top Today) · 1
https://www.reddit.com/r/LocalLLaMA/top/?t=day
google/gemma-4-12B · Hugging Face
LLMMultimodalOpenSource
TL;DR. Google Gemma 4 12B 공개, 멀티모달·256K 컨텍스트·140개 언어 지원
  • Google DeepMind의 오픈 웨이트 Gemma 4 계열 중 12B 모델 공개
  • 텍스트·이미지 입력과 텍스트 출력 지원, 12B 포함 일부 모델은 오디오 입력 지원
  • 최대 256K 토큰 컨텍스트 윈도와 140개 이상 언어 지원
Hacker News Front Page · 1
https://news.ycombinator.com/
Gemma 4 12B: A unified, encoder-free multimodal model
MultimodalLLMResearch
TL;DR. Gemma 4 12B 공개, 인코더 없는 통합 멀티모달 모델 설계
  • Gemma 4 12B를 텍스트·이미지 입력을 함께 다루는 unified multimodal 모델로 소개
  • 별도 비전 인코더 없이 동작하는 encoder-free 구조를 전면에 내세운 설계
  • 12B 규모에서 멀티모달 처리와 단일 아키텍처 통합을 겨냥한 Gemma 계열 확장