Daily Paper Cast
Jingwen Liang, Gengyu Wang
We update every weekday to discuss highest-voted papers from Huggingface Daily Paper (https://huggingface.co/papers). Both the podcast scripts and audio are generated by AI. Feedback and suggestions are welcome! Email us: [email protected]:Jingwen Liang, 3D ML, https://www.linkedin.com/in/jingwen-liang/Gengyu Wang, LLM ML, http://wanggengyu.comListen on: Spotify: https://open.spotify.com/show/21nrhmdaA8qoBiH8q03NXLApple Podcast: https://podcasts.apple.com/us/podcast/daily-paper-...
Episodes (1777)
MentraSuite: Post-Training Large Language Models for Mental Health Reasoning and...
Daily Paper Cast
EgoX: Egocentric Video Generation from a Single Exocentric Video
Daily Paper Cast
DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry
Daily Paper Cast
SVG-T2I: Scaling Up Text-to-Image Latent Diffusion Model Without Variational Aut...
Daily Paper Cast
V-RGBX: Video Editing with Accurate Controls over Intrinsic Properties
Daily Paper Cast
T-pro 2.0: An Efficient Russian Hybrid-Reasoning Model and Playground
Daily Paper Cast
Long-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solving
Daily Paper Cast
Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation
Daily Paper Cast
OPV: Outcome-based Process Verifier for Efficient Long Chain-of-Thought Verifica...
Daily Paper Cast
Achieving Olympia-Level Geometry Large Language Model Agent via Complexity Boost...
Daily Paper Cast
StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation
Daily Paper Cast
BrainExplore: Large-Scale Discovery of Interpretable Visual Representations in t...
Daily Paper Cast
OmniPSD: Layered PSD Generation with Diffusion Transformer
Daily Paper Cast
Composing Concepts from Images and Videos via Concept-prompt Binding
Daily Paper Cast
Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance
Daily Paper Cast
Visionary: The World Model Carrier Built on WebGPU-Powered Gaussian Splatting Pl...
Daily Paper Cast
Preserving Source Video Realism: High-Fidelity Face Swapping for Cinematic Quali...
Daily Paper Cast
OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory
Daily Paper Cast
Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcem...
Daily Paper Cast
Beyond Real: Imaginary Extension of Rotary Position Embeddings for Long-Context...
Daily Paper Cast
Unified Video Editing with Temporal Reasoner
Daily Paper Cast
Voxify3D: Pixel Art Meets Volumetric Rendering
Daily Paper Cast
Scaling Zero-Shot Reference-to-Video Generation
Daily Paper Cast
DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems
Daily Paper Cast
TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Fl...
Daily Paper Cast
EditThinker: Unlocking Iterative Reasoning for Any Image Editor
Daily Paper Cast
From Imitation to Discrimination: Toward A Generalized Curriculum Advantage Mech...
Daily Paper Cast
EMMA: Efficient Multimodal Understanding, Generation, and Editing with a Unified...
Daily Paper Cast
DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle
Daily Paper Cast
Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Le...
Daily Paper Cast
Nex-N1: Agentic Models Trained via a Unified Ecosystem for Large-Scale Environme...
Daily Paper Cast
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool U...
Daily Paper Cast
Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution...
Daily Paper Cast
Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchron...
Daily Paper Cast
PaperDebugger: A Plugin-Based Multi-Agent System for In-Editor Academic Writing,...
Daily Paper Cast
Qwen3-VL Technical Report
Daily Paper Cast
Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling...
Daily Paper Cast
PretrainZero: Reinforcement Active Pretraining
Daily Paper Cast
ViDiC: Video Difference Captioning
Daily Paper Cast
DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models
Daily Paper Cast
ToolOrchestra: Elevating Intelligence via Efficient Model and Tool Orchestration
Daily Paper Cast
MultiShotMaster: A Controllable Multi-Shot Video Generation Framework
Daily Paper Cast
MG-Nav: Dual-Scale Visual Navigation via Sparse Spatial Memory
Daily Paper Cast
Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinkin...
Daily Paper Cast
DualCamCtrl: Dual-Branch Diffusion Model for Geometry-Aware Camera-Controlled Vi...
Daily Paper Cast
Guided Self-Evolving LLMs with Minimal Human Supervision
Daily Paper Cast
SimScale: Learning to Drive via Real-World Simulation at Scale
Daily Paper Cast
InnoGym: Benchmarking the Innovation Potential of AI Agents
Daily Paper Cast
LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling
Daily Paper Cast
Envision: Benchmarking Unified Understanding & Generation for Causal World Proce...
Daily Paper Cast
