Daily Paper Cast
Jingwen Liang, Gengyu Wang
We update every weekday to discuss highest-voted papers from Huggingface Daily Paper (https://huggingface.co/papers). Both the podcast scripts and audio are generated by AI. Feedback and suggestions are welcome! Email us: [email protected]:Jingwen Liang, 3D ML, https://www.linkedin.com/in/jingwen-liang/Gengyu Wang, LLM ML, http://wanggengyu.comListen on: Spotify: https://open.spotify.com/show/21nrhmdaA8qoBiH8q03NXLApple Podcast: https://podcasts.apple.com/us/podcast/daily-paper-...
Episodes (1777)
DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training
Daily Paper Cast
AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration
Daily Paper Cast
InternSVG: Towards Unified SVG Tasks with Multimodal Large Language Models
Daily Paper Cast
BrowserAgent: Building Web Agents with Human-Inspired Web Browsing Actions
Daily Paper Cast
D2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied...
Daily Paper Cast
Thinking with Camera: A Unified Multimodal Model for Camera-Centric Understandin...
Daily Paper Cast
TAG:Tangential Amplifying Guidance for Hallucination-Resistant Diffusion Samplin...
Daily Paper Cast
AutoPR: Let's Automate Your Academic Promotion!
Daily Paper Cast
Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs
Daily Paper Cast
BEAR: Benchmarking and Enhancing Multimodal Language Models for Atomic Embodied...
Daily Paper Cast
StreamingVLM: Real-Time Understanding for Infinite Video Streams
Daily Paper Cast
Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels
Daily Paper Cast
BigCodeArena: Unveiling More Reliable Human Preferences in Code Generation via E...
Daily Paper Cast
R-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth...
Daily Paper Cast
Agent Learning via Early Experience
Daily Paper Cast
MM-HELIX: Boosting Multimodal Long-Chain Reflective Reasoning with Holistic Plat...
Daily Paper Cast
MemMamba: Rethinking Memory Patterns in State Space Model
Daily Paper Cast
UniVideo: Unified Understanding, Generation, and Editing for Videos
Daily Paper Cast
From What to Why: A Multi-Agent System for Evidence-based Chemical Reaction Cond...
Daily Paper Cast
When Thoughts Meet Facts: Reusable Reasoning for Long-Context LMs
Daily Paper Cast
Meta-Awareness Enhances Reasoning Models: Self-Alignment Reinforcement Learning
Daily Paper Cast
VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via...
Daily Paper Cast
The Alignment Waltz: Jointly Training Agents to Collaborate for Safety
Daily Paper Cast
Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense
Daily Paper Cast
Cache-to-Cache: Direct Semantic Communication Between Large Language Models
Daily Paper Cast
Ming-UniVision: Joint Image Understanding and Generation with a Unified Continuo...
Daily Paper Cast
Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation...
Daily Paper Cast
SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models
Daily Paper Cast
MATRIX: Mask Track Alignment for Interaction-aware Video Generation
Daily Paper Cast
RLinf-VLA: A Unified and Efficient Framework for VLA+RL Training
Daily Paper Cast
Vibe Checker: Aligning Code Evaluation with Human Preference
Daily Paper Cast
Less is More: Recursive Reasoning with Tiny Networks
Daily Paper Cast
TaTToo: Tool-Grounded Thinking PRM for Test-Time Scaling in Tabular Reasoning
Daily Paper Cast
Fathom-DeepResearch: Unlocking Long Horizon Information Retrieval and Synthesis...
Daily Paper Cast
In-the-Flow Agentic System Optimization for Effective Planning and Tool Use
Daily Paper Cast
Fast-dLLM v2: Efficient Block-Diffusion LLM
Daily Paper Cast
CoDA: Coding LM via Diffusion Adaptation
Daily Paper Cast
Drax: Speech Recognition with Discrete Flow Matching
Daily Paper Cast
Paper2Video: Automatic Video Generation from Scientific Papers
Daily Paper Cast
MITS: Enhanced Tree Search Reasoning for LLMs via Pointwise Mutual Information
Daily Paper Cast
Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal...
Daily Paper Cast
VChain: Chain-of-Visual-Thought for Reasoning in Video Generation
Daily Paper Cast
Imperceptible Jailbreaking against Large Language Models
Daily Paper Cast
Agentic Context Engineering: Evolving Contexts for Self-Improving Language Model...
Daily Paper Cast
Hybrid Architectures for Language Models: Systematic Analysis and Design Insight...
Daily Paper Cast
Optimal Scaling Needs Optimal Norm
Daily Paper Cast
Apriel-1.5-15b-Thinker
Daily Paper Cast
Large Reasoning Models Learn Better Alignment from Flawed Thinking
Daily Paper Cast
Efficient Multi-modal Large Language Models via Progressive Consistency Distilla...
Daily Paper Cast
LongCodeZip: Compress Long Context for Code Language Models
Daily Paper Cast
