Daily Paper Cast
Jingwen Liang, Gengyu Wang
We update every weekday to discuss highest-voted papers from Huggingface Daily Paper (https://huggingface.co/papers). Both the podcast scripts and audio are generated by AI. Feedback and suggestions are welcome! Email us: [email protected]:Jingwen Liang, 3D ML, https://www.linkedin.com/in/jingwen-liang/Gengyu Wang, LLM ML, http://wanggengyu.comListen on: Spotify: https://open.spotify.com/show/21nrhmdaA8qoBiH8q03NXLApple Podcast: https://podcasts.apple.com/us/podcast/daily-paper-...
Episodes (1777)
Video models are zero-shot learners and reasoners
Daily Paper Cast
SIM-CoT: Supervised Implicit Chain-of-Thought
Daily Paper Cast
Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR
Daily Paper Cast
Reinforcement Learning on Pre-Training Data
Daily Paper Cast
Do You Need Proprioceptive States in Visuomotor Policies?
Daily Paper Cast
MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Reci...
Daily Paper Cast
LIMI: Less is More for Agency
Daily Paper Cast
Qwen3-Omni Technical Report
Daily Paper Cast
OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer...
Daily Paper Cast
OnePiece: Bringing Context Engineering and Reasoning to Industrial Cascade Ranki...
Daily Paper Cast
TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Vide...
Daily Paper Cast
RPG: A Repository Planning Graph for Unified and Scalable Codebase Generation
Daily Paper Cast
MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tok...
Daily Paper Cast
Latent Zoning Network: A Unified Principle for Generative Modeling, Representati...
Daily Paper Cast
ScaleCUA: Scaling Open-Source Computer Use Agents with Cross-Platform Data
Daily Paper Cast
FlowRL: Matching Reward Distributions for LLM Reasoning
Daily Paper Cast
Reasoning over Boundaries: Enhancing Specification Alignment via Test-time Delib...
Daily Paper Cast
Evolving Language Models without Labels: Majority Drives Selection, Novelty Prom...
Daily Paper Cast
FinSearchComp: Towards a Realistic, Expert-Level Evaluation of Financial Search...
Daily Paper Cast
Understand Before You Generate: Self-Guided Training for Autoregressive Image Ge...
Daily Paper Cast
Hala Technical Report: Building Arabic-Centric Instruction & Translation Models...
Daily Paper Cast
SAIL-VL2 Technical Report
Daily Paper Cast
PANORAMA: The Rise of Omnidirectional Vision in the Embodied AI Era
Daily Paper Cast
WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended D...
Daily Paper Cast
Scaling Agents via Continual Pre-training
Daily Paper Cast
WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Sc...
Daily Paper Cast
Towards General Agentic Intelligence via Environment Scaling
Daily Paper Cast
WebResearcher: Unleashing unbounded reasoning capability in Long-Horizon Agents
Daily Paper Cast
ReSum: Unlocking Long-Horizon Search Intelligence via Context Summarization
Daily Paper Cast
Single-stream Policy Optimization
Daily Paper Cast
OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling
Daily Paper Cast
UI-S1: Advancing GUI Automation via Semi-online Reinforcement Learning
Daily Paper Cast
InternScenes: A Large-scale Simulatable Indoor Scene Dataset with Realistic Layo...
Daily Paper Cast
IntrEx: A Dataset for Modeling Engagement in Educational Conversations
Daily Paper Cast
The Illusion of Diminishing Returns: Measuring Long Horizon Execution in LLMs
Daily Paper Cast
VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model
Daily Paper Cast
HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
Daily Paper Cast
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
Daily Paper Cast
EchoX: Towards Mitigating Acoustic-Semantic Gap via Echo Training for Speech-to-...
Daily Paper Cast
Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM...
Daily Paper Cast
Kling-Avatar: Grounding Multimodal Instructions for Cascaded Long-Duration Avata...
Daily Paper Cast
FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset an...
Daily Paper Cast
Can Understanding and Generation Truly Benefit Together -- or Just Coexist?
Daily Paper Cast
MachineLearningLM: Scaling Many-shot In-context Learning via Continued Pretraini...
Daily Paper Cast
A Survey of Reinforcement Learning for Large Reasoning Models
Daily Paper Cast
RewardDance: Reward Scaling in Visual Generation
Daily Paper Cast
3D and 4D World Modeling: A Survey
Daily Paper Cast
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-...
Daily Paper Cast
Parallel-R1: Towards Parallel Thinking via Reinforcement Learning
Daily Paper Cast
Visual Representation Alignment for Multimodal Large Language Models
Daily Paper Cast
