
Daily Paper Cast
Jingwen Liang, Gengyu Wang
We update every weekday to discuss highest-voted papers from Huggingface Daily Paper (https://huggingface.co/papers). Both the podcast scripts and audio are generated by AI. Feedback and suggestions are welcome! Email us: [email protected]:Jingwen Liang, 3D ML, https://www.linkedin.com/in/jingwen-liang/Gengyu Wang, LLM ML, http://wanggengyu.comListen on: Spotify: https://open.spotify.com/show/21nrhmdaA8qoBiH8q03NXLApple Podcast: https://podcasts.apple.com/us/podcast/daily-paper-...
Episodes (1777)
SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing
Daily Paper Cast
LightThinker++: From Reasoning Compression to Memory Management
Daily Paper Cast
Self-Distilled RLVR
Daily Paper Cast
A Simple Baseline for Streaming Video Understanding
Daily Paper Cast
Token Warping Helps MLLMs Look from Nearby Viewpoints
Daily Paper Cast
Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?
Daily Paper Cast
DataFlex: A Unified Framework for Data-Centric Dynamic Training of Large Languag...
Daily Paper Cast
The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook
Daily Paper Cast
Generative World Renderer
Daily Paper Cast
SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization
Daily Paper Cast
Steerable Visual Representations
Daily Paper Cast
EgoSim: Egocentric World Simulator for Embodied Interaction Generation
Daily Paper Cast
CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery
Daily Paper Cast
ClawKeeper: Comprehensive Safety Protection for OpenClaw Agents Through Skills,...
Daily Paper Cast
Terminal Agents Suffice for Enterprise Automation
Daily Paper Cast
MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome
Daily Paper Cast
ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoner...
Daily Paper Cast
Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent V...
Daily Paper Cast
QuitoBench: A High-Quality Open Time Series Forecasting Benchmark
Daily Paper Cast
Reasoning Shift: How Context Silently Shortens LLM Reasoning
Daily Paper Cast
FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization
Daily Paper Cast
CARLA-Air: Fly Drones Inside a CARLA World -- A Unified Infrastructure for Air-G...
Daily Paper Cast
LongCat-Next: Lexicalizing Modalities as Discrete Tokens
Daily Paper Cast
Lingshu-Cell: A generative cellular world model for transcriptome modeling towar...
Daily Paper Cast
GEMS: Agent-Native Multimodal Generation with Memory and Skills
Daily Paper Cast
Project Imaging-X: A Survey of 1000+ Open-Access Medical Imaging Datasets for Fo...
Daily Paper Cast
VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward
Daily Paper Cast
Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis
Daily Paper Cast
CutClaw: Agentic Hours-Long Video Editing via Music Synchronization
Daily Paper Cast
daVinci-LLM:Towards the Science of Pretraining
Daily Paper Cast
TAPS: Task Aware Proposal Distributions for Speculative Sampling
Daily Paper Cast
Towards a Medical AI Scientist
Daily Paper Cast
Gen-Searcher: Reinforcing Agentic Search for Image Generation
Daily Paper Cast
Emergent Social Intelligence Risks in Generative Multi-Agent Systems
Daily Paper Cast
EpochX: Building the Infrastructure for an Emergent Agent Civilization
Daily Paper Cast
On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual...
Daily Paper Cast
GEditBench v2: A Human-Aligned Benchmark for General Image Editing
Daily Paper Cast
Make Geometry Matter for Spatial Reasoning
Daily Paper Cast
PRBench: End-to-end Paper Reproduction in Physics Research
Daily Paper Cast
PixelSmile: Toward Fine-Grained Facial Expression Editing
Daily Paper Cast
Intern-S1-Pro: Scientific Multimodal Foundation Model at Trillion Scale
Daily Paper Cast
Calibri: Enhancing Diffusion Transformers via Parameter-Efficient Calibration
Daily Paper Cast
RealRestorer: Towards Generalizable Real-World Image Restoration with Large-Scal...
Daily Paper Cast
MACRO: Advancing Multi-Reference Image Generation with Structured Long-Context D...
Daily Paper Cast
Voxtral TTS
Daily Paper Cast
Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?
Daily Paper Cast
MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Dec...
Daily Paper Cast
WildWorld: A Large-Scale Dataset for Dynamic World Modeling with Actions and Exp...
Daily Paper Cast
From Static Templates to Dynamic Runtime Graphs: A Survey of Workflow Optimizati...
Daily Paper Cast
SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Pl...
Daily Paper Cast