Daily Paper Cast
Jingwen Liang, Gengyu Wang
We update every weekday to discuss highest-voted papers from Huggingface Daily Paper (https://huggingface.co/papers). Both the podcast scripts and audio are generated by AI. Feedback and suggestions are welcome! Email us: [email protected]:Jingwen Liang, 3D ML, https://www.linkedin.com/in/jingwen-liang/Gengyu Wang, LLM ML, http://wanggengyu.comListen on: Spotify: https://open.spotify.com/show/21nrhmdaA8qoBiH8q03NXLApple Podcast: https://podcasts.apple.com/us/podcast/daily-paper-...
Episodes (1777)
TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times
Daily Paper Cast
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Mode...
Daily Paper Cast
DreaMontage: Arbitrary Frame-Guided One-Shot Video Generation
Daily Paper Cast
T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation
Daily Paper Cast
SemanticGen: Video Generation in Semantic Space
Daily Paper Cast
Bottom-up Policy Optimization: Your Language Model Policy Secretly Contains Inte...
Daily Paper Cast
LongVideoAgent: Multi-Agent Reasoning with Long Videos
Daily Paper Cast
SpatialTree: How Spatial Abilities Branch Out in MLLMs
Daily Paper Cast
DataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Auto...
Daily Paper Cast
The Prism Hypothesis: Harmonizing Semantic and Pixel Representations via Unified...
Daily Paper Cast
Region-Constraint In-Context Generation for Instructional Video Editing
Daily Paper Cast
QuCo-RAG: Quantifying Uncertainty from the Pre-training Corpus for Dynamic Retri...
Daily Paper Cast
Infinite-Homography as Robust Conditioning for Camera-Controlled Video Generatio...
Daily Paper Cast
Can LLMs Estimate Student Struggles? Human-AI Difficulty Alignment with Proficie...
Daily Paper Cast
Probing Scientific General Intelligence of LLMs with Scientist-Aligned Workflows
Daily Paper Cast
PhysBrain: Human Egocentric Data as a Bridge from Vision Language Models to Phys...
Daily Paper Cast
When Reasoning Meets Its Laws
Daily Paper Cast
Seed-Prover 1.5: Mastering Undergraduate-Level Theorem Proving via Learning from...
Daily Paper Cast
4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation
Daily Paper Cast
Both Semantics and Reconstruction Matter: Making Representation Encoders Ready f...
Daily Paper Cast
Are We on the Right Way to Assessing LLM-as-a-Judge?
Daily Paper Cast
Kling-Omni Technical Report
Daily Paper Cast
Adaptation of Agentic AI
Daily Paper Cast
LLaDA2.0: Scaling Up Diffusion Language Models to 100B
Daily Paper Cast
Next-Embedding Prediction Makes Strong Vision Learners
Daily Paper Cast
StereoPilot: Learning Unified and Efficient Stereo Conversion via Generative Pri...
Daily Paper Cast
Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model
Daily Paper Cast
Depth Any Panoramas: A Foundation Model for Panoramic Depth Estimation
Daily Paper Cast
Generative Refocusing: Flexible Defocus Control from a Single Image
Daily Paper Cast
DeContext as Defense: Safe Image Editing in Diffusion Transformers
Daily Paper Cast
Step-GUI Technical Report
Daily Paper Cast
DEER: Draft with Diffusion, Verify with Autoregressive Models
Daily Paper Cast
Fast and Accurate Causal Parallel Decoding using Jacobi Forcing
Daily Paper Cast
HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devic...
Daily Paper Cast
Puzzle Curriculum GRPO for Vision-Centric Reasoning
Daily Paper Cast
MMGR: Multi-Modal Generative Reasoning
Daily Paper Cast
Video Reality Test: Can AI-Generated ASMR Videos fool VLMs and Humans?
Daily Paper Cast
WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive Wor...
Daily Paper Cast
Scone: Bridging Composition and Distinction in Subject-Driven Image Generation v...
Daily Paper Cast
RoboTracer: Mastering Spatial Trace with Reasoning in Vision-Language Models for...
Daily Paper Cast
OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Valu...
Daily Paper Cast
ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding
Daily Paper Cast
Towards Scalable Pre-training of Visual Tokenizers for Generation
Daily Paper Cast
Memory in the Age of AI Agents
Daily Paper Cast
QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Manage...
Daily Paper Cast
LongVie 2: Multimodal Controllable Ultra-Long Video World Model
Daily Paper Cast
Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise W...
Daily Paper Cast
NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding A...
Daily Paper Cast
Error-Free Linear Attention is a Free Lunch: Exact Solution from Continuous-Time...
Daily Paper Cast
KlingAvatar 2.0 Technical Report
Daily Paper Cast
