← 아카이브 목록
 TH—NEWS

Morning Digest — 2026-07-28

10 posts · 9 sources · ✓ 06:30 KST
제목 클릭 시 원문으로 이동
📌 오늘의 핵심 요약. 오늘은 코딩 에이전트 실사용감과 오픈 웨이트 공개, 그리고 바로 써볼 수 있는 오픈소스 툴이 같이 올라와서 훑는 맛이 괜찮습니다. 깊게 읽을 건 Kimi K3 weight 공개, opencodex: 어떤 LLM이든 Codex와 Claude Code에서 쓰게 해주는 범용 프록시, NanmiCoder/MediaCrawler 정도이고, 나머지는 관심사 맞으면 골라 읽는 식으로 봐도 충분해요.
🔥 꼭 볼 것
01 Kimi K3 weight 공개
Moonshot AI가 2.8T급 오픈 웨이트 멀티모달 에이전트 모델을 공개했습니다.
💡 오픈 모델 선택지와 에이전트 실험 폭이 넓어집니다.
02 opencodex: 어떤 LLM이든 Codex와 Claude Code에서 쓰게 해주는 범용 프록시
Codex·Claude Code에 원하는 LLM을 물려 쓰게 해주는 범용 프록시 도구입니다.
💡 기존 코딩 워크플로에 모델 교체 실험을 바로 붙일 수 있어요.
03 NanmiCoder/MediaCrawler
Playwright·CDP 기반으로 여러 플랫폼의 공개 데이터를 수집하는 크롤링 도구입니다.
💡 데이터 수집 자동화와 프로토타입 구축에 바로 도움 됩니다.
👀 관심 있으면 볼 것
LLM/Agent
소스 제목 한줄 요약
PyTorch KR EgoControl: 3D 전신 포즈로 1인칭 시점 영상을 제어하는 비디오 확산 모델 (feat. NVIDIA) 3D 전신 포즈 조건으로 1인칭 영상을 제어하는 비디오 확산 모델
PyTorch KR Palmier Pro: AI와 함께 타임라인에서 영상을 만드는 macOS 오픈소스 편집기 어제 타임라인 안에서 생성·편집·에이전트 협업을 묶은 macOS 오픈소스 영상 편집기
HF Papers Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinfo… 에이전트형 강화학습용 확장형 PyTorch 네이티브 학습 프레임워크 Molt 제안
HF Papers Multi-Head Latent Control: A Unified Interface for LLM Agent Decision… LLM 에이전트 의사결정을 통합하는 다중 헤드 잠재 제어 인터페이스 제안
AI Lab Blogs NVIDIA Ising Enables Fully Automated Quantum Computer Calibration wit… NVIDIA Ising 기반 양자 컴퓨터 캘리브레이션 자동화 VLM 공개
r/LocalLLaMA (Top Today) Harness showdown: Claude Code vs OpenCode vs Pi with DeepSeek V4 Flash 어제 동일 모델 기준 코딩 하네스 3종 비교에서 품질 유사·속도 차이 확인
Research
소스 제목 한줄 요약
Hacker News Front Page Show HN: FeyNoBg – Automatic background removal model and training li… 배경 제거 모델 FeyNoBg와 학습 라이브러리 NoBg 오픈소스 공개
📚 전체 목록 (소스별)
GitHub Trending · 1
https://github.com/trending
NanmiCoder/MediaCrawler Python · 349 stars today · ⭐ 58,127
ToolingDataPython
TL;DR. Playwright·CDP 기반 멀티플랫폼 공개 데이터 수집 도구
  • 샤오홍슈·더우인·콰이쇼우·Bilibili·웨이보·바이두티에바·즈후 등 7개 플랫폼 공개 정보와 댓글 수집 지원
  • Playwright 로그인 상태 저장과 Chrome CDP 연결 기반 구성, 복잡한 JS 역분석 없이 서명 파라미터 획득
  • 키워드 검색·게시물 ID 지정 수집·2차 댓글·작성자 홈 수집·IP 프록시 풀·댓글 워드클라우드 생성 기능 제공
왜 중요한가 복잡한 플랫폼별 암호화 로직 역공학 대신 브라우저 로그인 컨텍스트와 CDP를 활용해 수집 진입장벽을 낮춘 점이 특징이다. 다수의 중국 소셜 플랫폼을 단일 도구와 WebUI로 다루려는 워크플로에 참고할 만하다.
추천 대상 웹 자동화·데이터 수집 파이프라인·Playwright 활용 사례에 관심 있는 Python 개발자
PyTorch KR 읽을거리 · 3
https://discuss.pytorch.kr/c/news/14
EgoControl: 3D 전신 포즈로 1인칭 시점 영상을 제어하는 비디오 확산 모델 (feat. NVIDIA)
VideoDiffusionResearch
TL;DR. 3D 전신 포즈 조건으로 1인칭 영상을 제어하는 비디오 확산 모델
  • EgoControl 기반의 1인칭 시점 비디오 생성·제어 접근
  • 3D 전신 포즈를 조건으로 활용해 카메라 시점과 신체 움직임 정합성 강화
  • 비디오 확산 모델(video diffusion model)로 시간적 일관성과 동작 표현 동시 개선
왜 중요한가 기존 비디오 생성은 1인칭 시점에서 신체 움직임과 카메라 변화의 일관성 확보가 어려운 편이다. 이 접근은 3D 전신 포즈를 제어 신호로 써 egocentric video 생성의 제어 가능성과 활용성을 높인다는 점이 중요하다.
추천 대상 비디오 생성, 확산 모델, 모션 조건 제어에 관심 있는 AI 엔지니어
opencodex: 어떤 LLM이든 Codex와 Claude Code에서 쓰게 해주는 범용 프록시 어제
LLMCodingTooling
TL;DR. Codex·Claude Code에 임의 LLM을 연결하는 범용 프록시 도구
  • OpenCodex를 통해 특정 코딩 에이전트 UI에서 다양한 LLM 백엔드 사용 지원
  • Codex와 Claude Code를 대상으로 한 프록시 계층 제공이 핵심 차별점
  • 모델 종속성을 낮춰 도구 인터페이스와 실제 추론 모델 분리 가능성
왜 중요한가 코딩 에이전트 도구가 특정 모델 생태계에 묶이는 문제를 완화하는 접근으로 보인다. 프록시 계층으로 인터페이스는 유지하면서 원하는 LLM을 연결할 수 있어 실험 유연성과 운영 선택지를 넓힌다.
추천 대상 Codex·Claude Code 기반 개발 환경에서 다른 LLM을 붙여 쓰고 싶은 AI 엔지니어
Palmier Pro: AI와 함께 타임라인에서 영상을 만드는 macOS 오픈소스 편집기 어제
GenerativeAgentOpenSource
TL;DR. 타임라인 안에서 생성·편집·에이전트 협업을 묶은 macOS 오픈소스 영상 편집기
  • Swift로 처음부터 구현한 macOS 네이티브 편집기, Premiere Pro 지향의 타임라인 기반 UX
  • Seedance, Kling, Nano Banana Pro 등 SOTA 모델로 영상·이미지 생성 기능을 편집기 내부에 통합
  • Claude Code·Codex·Cursor를 HTTP 기반 MCP 서버(http://127.0.0.1:19789/mcp)로 연결해 동일 프로젝트 공동 편집 지원
왜 중요한가 기존 AI 영상 도구의 생성과 편집 분리 문제를 줄이고, 타임라인 안에서 생성 모델과 에이전트 협업을 직접 연결한 점이 핵심입니다. 오픈소스 편집기와 MCP 연동을 분리 공개해 실사용 편집 워크플로우에 AI를 붙이는 방식도 구체적으로 제시합니다.
추천 대상 AI 영상 제작 워크플로우와 MCP 기반 에이전트 협업 도구에 관심 있는 개발자·크리에이터
GeekNews 최신 · 1
https://news.hada.io/new
Kimi K3 weight 공개
LLMMultimodalOpenSource
TL;DR. Moonshot AI, 2.8T 오픈 웨이트 멀티모달 에이전트 모델 Kimi K3 공개
  • 2.8T 파라미터·104B 활성화 MoE 구조, 896개 전문가 중 16개 선택 활성화
  • Kimi Delta Attention(KDA)·AttnRes·Stable LatentMoE 적용, Kimi K2 대비 스케일링 효율 약 2.5배 개선
  • 텍스트·이미지 네이티브 멀티모달과 100만 토큰 컨텍스트 지원, 비전 인코더 MoonViT-V2 401M 포함
왜 중요한가 3T급에 가까운 초대형 모델의 전체 가중치를 공개했다는 점이 핵심이다. 긴 컨텍스트, 멀티모달, 에이전트 작업을 한 모델로 묶어 연구용뿐 아니라 실제 배포·튜닝 기반으로도 검토할 만한 선택지를 넓힌다.
추천 대상 오픈 웨이트 대형 LLM, 멀티모달 에이전트, 장문맥 코딩 모델을 추적하는 ML 엔지니어
HuggingFace Daily Papers · 2
https://huggingface.co/papers
Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning arXiv
AgentReinforcementTraining
TL;DR. 에이전트형 강화학습용 확장형 PyTorch 네이티브 학습 프레임워크 Molt 제안
  • 에이전트형 강화학습(agentic RL) 학습을 위한 PyTorch 네이티브 프레임워크 제안
  • 확장성(scalable)에 초점을 둔 설계로 대규모 학습 워크로드 대응 지향
  • 훈련 프레임워크 자체를 주제로 하며 모델이 아닌 학습 인프라·파이프라인 관점의 접근
왜 중요한가 에이전트형 시스템이 복잡한 상호작용과 장기 과제를 다루면서, 강화학습 학습 스택의 확장성과 구현 복잡도가 병목이 되는 경우가 많다. Molt는 PyTorch 네이티브 기반으로 이 문제를 다루려는 프레임워크라는 점에서 연구·실험 생산성 측면의 의미가 있다.
추천 대상 에이전트 RL 학습 스택, 분산 훈련, PyTorch 기반 실험 인프라에 관심 있는 ML 엔지니어
Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making arXiv
AgentLLMResearch
TL;DR. LLM 에이전트 의사결정을 통합하는 다중 헤드 잠재 제어 인터페이스 제안
  • LLM 에이전트의 의사결정 과정을 위한 unified interface로 Multi-Head Latent Control 제안
  • 여러 제어 헤드(multi-head)와 잠재 표현(latent control)을 결합한 의사결정 구조 제시
  • 에이전트 의사결정 제어를 모델 인터페이스 수준에서 표준화하려는 연구 방향성
왜 중요한가 LLM 에이전트는 계획, 선택, 도구 사용 등 여러 결정을 한 시스템 안에서 다뤄야 해 제어 인터페이스가 복잡해지기 쉽다. 이 연구는 이를 통합된 잠재 제어 방식으로 다루려는 접근으로, 에이전트 설계와 제어 추상화의 공통 기반을 모색한다.
추천 대상 LLM 에이전트 아키텍처와 의사결정 제어 인터페이스에 관심 있는 연구자·ML 엔지니어
AI Lab Blogs · 1
https://openai.com/news
NVIDIA Ising Enables Fully Automated Quantum Computer Calibration with Enhanced In-Context Learning
MultimodalResearchOpenSource
TL;DR. NVIDIA Ising 기반 양자 컴퓨터 캘리브레이션 자동화 VLM 공개
  • 양자 프로세서 진단 출력 해석과 조정값 결정을 수행하는 오픈소스 비전언어모델(VLM) 설계
  • NVIDIA Ising Calibration 기반 완전 자동화 캘리브레이션 지향, 사람 개입 축소 목적
  • 향상된 인컨텍스트 러닝(enhanced in-context learning) 적용을 핵심 차별점으로 제시
왜 중요한가 양자 컴퓨터 캘리브레이션은 반복적이고 전문 인력 의존도가 높은 작업이다. 진단 이미지를 읽는 VLM과 인컨텍스트 러닝을 결합해 이 과정을 자동화하려는 접근이라는 점에서 운영 효율과 확장성 측면의 의미가 있다.
추천 대상 멀티모달 모델 응용, 과학 장비 자동화, 양자 컴퓨팅 운영에 관심 있는 엔지니어
r/LocalLLaMA (Top Today) · 1
https://www.reddit.com/r/LocalLLaMA/top/?t=day
Harness showdown: Claude Code vs OpenCode vs Pi with DeepSeek V4 Flash 어제
CodingInferenceTooling
TL;DR. 동일 모델 기준 코딩 하네스 3종 비교에서 품질 유사·속도 차이 확인
  • DeepSeek V4 Flash를 Claude Code, OpenCode, Pi에 연결해 자체 벤치마크 비교
  • 세 하네스 간 생성 코드 품질과 최종 diff는 대체로 비슷한 결과
  • 소요 시간과 토큰 사용량은 큰 차이, Claude Code는 최속 대비 약 4배 느린 결과
왜 중요한가 같은 모델을 써도 감싸는 하네스에 따라 응답 시간과 토큰 비용이 크게 달라질 수 있음을 보여준다. 코딩 에이전트 평가에서 모델 성능만이 아니라 실행 환경과 orchestration까지 함께 봐야 한다는 맥락이다.
추천 대상 코딩 에이전트 도구 선택과 LLM 비용·지연시간 최적화에 관심 있는 개발자
Hacker News Front Page · 1
https://news.ycombinator.com/
Show HN: FeyNoBg – Automatic background removal model and training library
VisionOpenSourceTraining
TL;DR. 배경 제거 모델 FeyNoBg와 학습 라이브러리 NoBg 오픈소스 공개
  • 8개 벤치마크 평가에서 4개 S-measure 최고 성능, 나머지도 선두 대비 2% 이내 결과
  • BiRefNet 기반 확장 구조 적용, 3단계 블록 수 18→24로 늘려 222M→263M 파라미터 구성
  • 위치 파악(localization)과 경계 복원(reconstruction) 분리를 유지하며 기존 사전학습 가중치 최대 보존
왜 중요한가 배경 제거는 전경 인식과 경계 정밀도(image matting)를 동시에 요구해 데이터 혼합과 학습 설계가 성능을 좌우한다. 이 글은 기존 BiRefNet을 소폭 확장하고 데이터셋 구성을 재설계해 고해상도·위장·복잡 장면 전반에서 균형 잡힌 성능을 확보한 과정을 공개한다.
추천 대상 이미지 세그멘테이션·매팅 모델 학습, 오픈소스 비전 모델 재학습에 관심 있는 ML 엔지니어