Daily Paper Cast
Jingwen Liang, Gengyu Wang
We update every weekday to discuss highest-voted papers from Huggingface Daily Paper (https://huggingface.co/papers). Both the podcast scripts and audio are generated by AI. Feedback and suggestions are welcome! Email us: [email protected]:Jingwen Liang, 3D ML, https://www.linkedin.com/in/jingwen-liang/Gengyu Wang, LLM ML, http://wanggengyu.comListen on: Spotify: https://open.spotify.com/show/21nrhmdaA8qoBiH8q03NXLApple Podcast: https://podcasts.apple.com/us/podcast/daily-paper-...
Episodes (1777)
Stabilizing Reinforcement Learning with LLMs: Formulation and Practices
Daily Paper Cast
How Far Are We from Genuinely Useful Deep Research Agents?
Daily Paper Cast
What about gravity in video generation? Post-Training Newton's Laws with Verifia...
Daily Paper Cast
Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autore...
Daily Paper Cast
The Consistency Critic: Correcting Inconsistencies in Generated Images via Refer...
Daily Paper Cast
TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models
Daily Paper Cast
LFM2 Technical Report
Daily Paper Cast
Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffu...
Daily Paper Cast
REASONEDIT: Towards Reasoning-Enhanced Image Editing Models
Daily Paper Cast
Vision Bridge Transformer at Scale
Daily Paper Cast
DeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoning
Daily Paper Cast
Architecture Decoupling Is Not All You Need For Unified Multimodal Model
Daily Paper Cast
Multimodal Evaluation of Russian-language Architectures
Daily Paper Cast
Latent Collaboration in Multi-Agent Systems
Daily Paper Cast
Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simu...
Daily Paper Cast
GigaEvo: An Open Source Optimization Framework Powered By LLMs And Evolution Alg...
Daily Paper Cast
MedSAM3: Delving into Segment Anything with Medical Concepts
Daily Paper Cast
Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Rea...
Daily Paper Cast
SteadyDancer: Harmonized and Coherent Human Image Animation with First-Frame Pre...
Daily Paper Cast
iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation
Daily Paper Cast
Does Understanding Inform Generation in Unified Multimodal Models? From Analysis...
Daily Paper Cast
GigaWorld-0: World Models as Data Engine to Empower Embodied AI
Daily Paper Cast
SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Fe...
Daily Paper Cast
Soft Adaptive Policy Optimization
Daily Paper Cast
General Agentic Memory Via Deep Research
Daily Paper Cast
AutoEnv: Automated Environments for Measuring Cross-Environment Agent Learning
Daily Paper Cast
Computer-Use Agents as Judges for Generative User Interface
Daily Paper Cast
DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
Daily Paper Cast
DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research
Daily Paper Cast
UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to-Image Generat...
Daily Paper Cast
In-Video Instructions: Visual Signals as Generative Control
Daily Paper Cast
OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and...
Daily Paper Cast
Unveiling Intrinsic Dimension of Texts: from Academic Abstract to Creative Story
Daily Paper Cast
GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization
Daily Paper Cast
SAM 3: Segment Anything with Concepts
Daily Paper Cast
Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities t...
Daily Paper Cast
Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation
Daily Paper Cast
What Does It Take to Be a Good AI Research Agent? Studying the Role of Ideation...
Daily Paper Cast
VisPlay: Self-Evolving Vision-Language Models from Images
Daily Paper Cast
Instruction-Guided Lesion Segmentation for Chest X-rays with Automatically Gener...
Daily Paper Cast
VIDEOP2R: Video Understanding from Perception to Reasoning
Daily Paper Cast
Think-at-Hard: Selective Latent Iterations to Improve Reasoning Language Models
Daily Paper Cast
AraLingBench A Human-Annotated Benchmark for Evaluating Arabic Linguistic Capabi...
Daily Paper Cast
A Style is Worth One Code: Unlocking Code-to-Style Image Generation with Discret...
Daily Paper Cast
Can World Simulators Reason? Gen-ViRe: A Generative Visual Reasoning Benchmark
Daily Paper Cast
MVI-Bench: A Comprehensive Benchmark for Evaluating Robustness to Misleading Vis...
Daily Paper Cast
REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning i...
Daily Paper Cast
Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced M...
Daily Paper Cast
P1: Mastering Physics Olympiads with Reinforcement Learning
Daily Paper Cast
MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents v...
Daily Paper Cast
