Daily Paper Cast
Jingwen Liang, Gengyu Wang
We update every weekday to discuss highest-voted papers from Huggingface Daily Paper (https://huggingface.co/papers). Both the podcast scripts and audio are generated by AI. Feedback and suggestions are welcome! Email us: [email protected]:Jingwen Liang, 3D ML, https://www.linkedin.com/in/jingwen-liang/Gengyu Wang, LLM ML, http://wanggengyu.comListen on: Spotify: https://open.spotify.com/show/21nrhmdaA8qoBiH8q03NXLApple Podcast: https://podcasts.apple.com/us/podcast/daily-paper-...
Episodes (1777)
EnvScaler: Scaling Tool-Interactive Environments for LLM Agent via Programmatic...
Daily Paper Cast
Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-A...
Daily Paper Cast
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward...
Daily Paper Cast
Learnable Multipliers: Freeing the Scale of Language Model Matrix Layers
Daily Paper Cast
RL-AWB: Deep Reinforcement Learning for Auto White Balance Correction in Low-Lig...
Daily Paper Cast
Token-Level LLM Collaboration via FusionRoute
Daily Paper Cast
Entropy-Adaptive Fine-Tuning: Resolving Confident Conflicts to Mitigate Forgetti...
Daily Paper Cast
Evolving Programmatic Skill Networks
Daily Paper Cast
Atlas: Orchestrating Heterogeneous Models and Tools for Multi-Domain Complex Rea...
Daily Paper Cast
Benchmark^2: Systematic Evaluation of LLM Benchmarks
Daily Paper Cast
InfiniDepth: Arbitrary-Resolution and Fine-Grained Depth Estimation with Neural...
Daily Paper Cast
LTX-2: Efficient Joint Audio-Visual Foundation Model
Daily Paper Cast
MOSS Transcribe Diarize: Accurate Transcription with Speaker Diarization
Daily Paper Cast
SciEvalKit: An Open-source Evaluation Toolkit for Scientific General Intelligenc...
Daily Paper Cast
NitroGen: An Open Foundation Model for Generalist Gaming Agents
Daily Paper Cast
Can LLMs Predict Their Own Failures? Self-Awareness via Internal Circuits
Daily Paper Cast
NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Gen...
Daily Paper Cast
DreamID-V:Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Di...
Daily Paper Cast
VAR RL Done Right: Tackling Asynchronous Policy Conflicts in Visual Autoregressi...
Daily Paper Cast
GARDO: Reinforcing Diffusion Models without Reward Hacking
Daily Paper Cast
InfiniteVGGT: Visual Geometry Grounded Transformer for Endless Streams
Daily Paper Cast
VINO: A Unified Visual Generator with Interleaved OmniModal Context
Daily Paper Cast
Youtu-Agent: Scaling Agent Productivity with Automated Generation and Hybrid Pol...
Daily Paper Cast
NeoVerse: Enhancing 4D World Model with in-the-wild Monocular Videos
Daily Paper Cast
Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Convers...
Daily Paper Cast
Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Vi...
Daily Paper Cast
SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforce...
Daily Paper Cast
Deep Delta Learning
Daily Paper Cast
AdaGaR: Adaptive Gabor Representation for Dynamic Scene Reconstruction
Daily Paper Cast
Nested Learning: The Illusion of Deep Learning Architectures
Daily Paper Cast
Improving Multi-step RAG with Hypergraph-based Memory for Long-Context Complex R...
Daily Paper Cast
Dynamic Large Concept Models: Latent Reasoning in an Adaptive Semantic Space
Daily Paper Cast
mHC: Manifold-Constrained Hyper-Connections
Daily Paper Cast
Youtu-LLM: Unlocking the Native Agentic Potential for Lightweight Large Language...
Daily Paper Cast
Let It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within a...
Daily Paper Cast
GaMO: Geometry-aware Multi-view Diffusion Outpainting for Sparse-View 3D Reconst...
Daily Paper Cast
Coupling Experts and Routers in Mixture-of-Experts via an Auxiliary Loss
Daily Paper Cast
LiveTalk: Real-Time Multimodal Interactive Video Diffusion via Improved On-Polic...
Daily Paper Cast
Yume-1.5: A Text-Controlled Interactive World Generation Model
Daily Paper Cast
SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents
Daily Paper Cast
Diffusion Knows Transparency: Repurposing Video Diffusion for Transparent Object...
Daily Paper Cast
Stream-DiffVSR: Low-Latency Streamable Video Super-Resolution via Auto-Regressiv...
Daily Paper Cast
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models wit...
Daily Paper Cast
SpotEdit: Selective Region Editing in Diffusion Transformers
Daily Paper Cast
GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion M...
Daily Paper Cast
InsertAnywhere: Bridging 4D Scene Geometry and Diffusion Models for Realistic Vi...
Daily Paper Cast
Mindscape-Aware Retrieval Augmented Generation for Improved Long Context Underst...
Daily Paper Cast
MAI-UI Technical Report: Real-World Centric Foundation GUI Agents
Daily Paper Cast
Latent Implicit Visual Reasoning
Daily Paper Cast
Emergent temporal abstractions in autoregressive models enable hierarchical rein...
Daily Paper Cast
