Morning Digest — 2026-04-29
10 posts · 8 sources · ✓ 06:30 KST
제목 클릭 시 원문으로 이동
📢
새 기능. 이제 Claude Code/Desktop에서 MCP로 다이제스트를 바로 물어볼 수 있어요. 자세한 방법은
FAQ를 확인하세요.
📚 전체 목록 (소스별)
CodingRAGOpenSource
TL;DR. 브라우저에서 저장소 지식 그래프와 Graph RAG를 만드는 코드 탐색 도구
- 서버 없이 브라우저에서 전부 실행되는 제로서버(code intelligence) 구조
- GitHub 저장소 URL이나 ZIP 파일 입력만으로 코드 기반 지식 그래프 생성
- 인터랙티브 지식 그래프와 내장 Graph RAG 에이전트 제공, 코드 탐색 지원
ResearchBenchmarkLLM
TL;DR. Stanford HAI 2026 AI Index, 역량 가속·미중 격차 축소·책임 AI 지체 진단
- 423쪽 분량 9개 챕터 구성 보고서로 기술 발전, 경제 효과, 사회 영향 데이터 중심 종합 분석
- 생성형 AI 3년 만에 전 세계 53% 채택, 기업 도입률 88%, 미국 대학생 80% 사용 확산
- 프런티어 모델 성능 상향과 미중 격차 축소 동시 진행, 2026년 3월 기준 최고 모델 격차 2.7%
AgentOpenSourceTooling
TL;DR. Warp 터미널 클라이언트 코드베이스의 AGPL-3.0 오픈소스 공개
- Warp가 터미널 기반 Agentic Development Environment의 클라이언트 저장소를 GitHub에 공개
- 저장소명 warpdotdev/warp, 라이선스는 AGPL-3.0 적용
- Rust 기반 구현으로 알려진 Warp 터미널 클라이언트 코드베이스 공개
HuggingFace Daily Papers · 1
AgentBenchmarkMultimodal
TL;DR. 장기·멀티턴·멀티모달 협업 에이전트 평가용 리빙월드 벤치마크 ClawMark 제안
- 여러 날에 걸친 상호작용, 멀티턴 작업, 멀티모달 입력을 포함한 coworker agent 평가 벤치마크 제안
- 정적 단일 에피소드 중심 평가를 넘어 변화하는 living-world 환경에서 장기 수행 능력 측정 지향
- 에이전트의 협업 맥락 유지, 작업 연속성, 환경 변화 대응을 함께 검증하는 평가 프레임워크 성격
MultimodalAgentOpenSource
TL;DR. 단일 오픈 모델로 멀티모달 에이전트 추론을 수행하는 Nemotron 3 Nano Omni 공개
- 화면·문서·오디오·비디오·텍스트를 단일 perception-to-action 루프에서 다루는 멀티모달 에이전트 지향 모델
- 기존 다중 모델 파이프라인 의존을 줄이고 단일 효율형 오픈 모델로 추론과 실행 경로 단순화
- NVIDIA Nemotron 3 Nano Omni 기반 구성으로 경량급(nano) 효율성과 멀티모달 처리 결합
LLMAgentInfra
TL;DR. OpenAI GPT·Codex·Managed Agents의 AWS 제공 확대
- OpenAI GPT 모델과 Codex, Managed Agents를 AWS 환경에서 사용할 수 있는 제공 발표
- 엔터프라이즈가 기존 AWS 인프라 안에서 보안 요구를 유지하며 AI 애플리케이션 구축 가능
- 모델 제공 범위를 단일 LLM API를 넘어 코딩과 에이전트 실행 계층까지 확장한 점
Simon Willison's Weblog · 1
LLMTrainingResearch
TL;DR. 1930년 이전 영어만 학습한 13B 빈티지 LLM talkie 공개
- talkie-1930-13b-base, 260B 토큰의 pre-1931 영어 텍스트로 학습한 13B 모델, 53.1GB 크기
- talkie-1930-13b-it, pre-1931 참고서 기반 지시응답 데이터로 파인튜닝한 채팅 체크포인트, 26.6GB
- 두 모델 모두 Apache 2.0 공개, 베이스 모델은 미국 저작권 만료 데이터만 사용한 점이 특징
r/LocalLLaMA (Top Today) · 2
LLMInferenceBenchmark
TL;DR. Qwen 3.6 27B의 BF16·Q4_K_M·Q8_0 양자화별 성능·속도·메모리 비교 평가
- Qwen 3.6 27B를 BF16, Q4_K_M, Q8_0 GGUF 세 변형으로 비교한 로컬 추론 평가
- llama-cpp-python과 Neo AI Engineer 기반 측정, HumanEval·HellaSwag·BFCL 벤치마크 사용
- BF16 기준 HumanEval 56.10%, HellaSwag 90.00%, BFCL 63.25%, 평균 정확도 69.78%
LLMCodingAgent
TL;DR. 로컬 코딩 LLM 실사용 평가에서 생산성 손실이 이점 상회
- 작성자, 몇 주간 비업무 기술 작업에 로컬 LLM 강제 적용 후 중단 결론
- 비교 기준으로 업무용 Claude Code 사용 경험 제시, 체감 성능 차이 강조
- 평가 모델로 Qwen 27B와 Gemma 4 31B 언급, 수백B 미만급 로컬 상위권 모델로 지목
Hacker News Front Page · 1
RAGSecurityAgent
TL;DR. 가짜 위키 인용으로 LLM 검색·RAG 신뢰를 오염시킨 실험
- 6nimmt.com 도메인과 위키피디아 편집 1건만으로 존재하지 않는 세계 챔피언 타이틀을 조작한 사례
- 위키 문단과 자기 사이트 보도자료가 서로를 뒷받침하는 순환 인용(circular citation)으로 신뢰 세탁 발생
- 여러 프런티어 LLM이 웹 검색 결과를 근거로 허위 사실을 다시 인용한 검색·RAG 취약성 시연