Daily Paper Cast
Jingwen Liang, Gengyu Wang
We update every weekday to discuss highest-voted papers from Huggingface Daily Paper (https://huggingface.co/papers). Both the podcast scripts and audio are generated by AI. Feedback and suggestions are welcome! Email us: [email protected]:Jingwen Liang, 3D ML, https://www.linkedin.com/in/jingwen-liang/Gengyu Wang, LLM ML, http://wanggengyu.comListen on: Spotify: https://open.spotify.com/show/21nrhmdaA8qoBiH8q03NXLApple Podcast: https://podcasts.apple.com/us/podcast/daily-paper-...
Episodes (1777)
Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search
Daily Paper Cast
Reconstruction Alignment Improves Unified Multimodal Models
Daily Paper Cast
UMO: Scaling Multi-Identity Consistency for Image Customization via Matching Rew...
Daily Paper Cast
Reverse-Engineered Reasoning for Open-Ended Generation
Daily Paper Cast
Does DINOv3 Set a New Medical Vision Standard?
Daily Paper Cast
Symbolic Graphics Programming with Large Language Models
Daily Paper Cast
Set Block Decoding is a Language Model Inference Accelerator
Daily Paper Cast
Drivel-ology: Challenging LLMs with Interpreting Nonsense with Depth
Daily Paper Cast
From Editor to Dense Geometry Estimator
Daily Paper Cast
Towards a Unified View of Large Language Model Post-Training
Daily Paper Cast
DeepResearch Arena: The First Exam of LLMs' Research Abilities via Seminar-Groun...
Daily Paper Cast
Inverse IFEval: Can LLMs Unlearn Stubborn Training Conventions to Follow Real In...
Daily Paper Cast
Open Data Synthesis For Deep Research
Daily Paper Cast
Robix: A Unified Model for Robot Interaction, Reasoning and Planning
Daily Paper Cast
UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Le...
Daily Paper Cast
LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model
Daily Paper Cast
ELV-Halluc: Benchmarking Semantic Aggregation Hallucinations in Long Video Under...
Daily Paper Cast
POINTS-Reader: Distillation-Free Adaptation of Vision-Language Models for Docume...
Daily Paper Cast
Baichuan-M2: Scaling Medical Capability with Large Verifier System
Daily Paper Cast
Kwai Keye-VL 1.5 Technical Report
Daily Paper Cast
Reasoning Vectors: Transferring Chain-of-Thought Capabilities via Task Arithmeti...
Daily Paper Cast
PVPO: Pre-Estimated Value-Based Policy Optimization for Agentic Reasoning
Daily Paper Cast
R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mod...
Daily Paper Cast
A Survey of Scientific Large Language Models: From Data Foundations to Agent Fro...
Daily Paper Cast
TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Effic...
Daily Paper Cast
VibeVoice Technical Report
Daily Paper Cast
CMPhysBench: A Benchmark for Evaluating Large Language Models in Condensed Matte...
Daily Paper Cast
VoxHammer: Training-Free Precise and Coherent 3D Editing in Native 3D Space
Daily Paper Cast
OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation
Daily Paper Cast
Spacer: Towards Engineered Scientific Inspiration
Daily Paper Cast
UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Contex...
Daily Paper Cast
InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning,...
Daily Paper Cast
Visual-CoG: Stage-Aware Reinforcement Learning with Chain of Guidance for Text-t...
Daily Paper Cast
MV-RAG: Retrieval Augmented Multiview Diffusion
Daily Paper Cast
Memento: Fine-tuning LLM Agents without Fine-tuning LLMs
Daily Paper Cast
Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVR
Daily Paper Cast
ODYSSEY: Open-World Quadrupeds Exploration and Manipulation for Long-Horizon Tas...
Daily Paper Cast
Intern-S1: A Scientific Multimodal Foundation Model
Daily Paper Cast
Mobile-Agent-v3: Foundamental Agents for GUI Automation
Daily Paper Cast
Deep Think with Confidence
Daily Paper Cast
LiveMCP-101: Stress Testing and Diagnosing MCP-enabled Agents on Challenging Que...
Daily Paper Cast
DuPO: Enabling Reliable LLM Self-Verification via Dual Preference Optimization
Daily Paper Cast
From Scores to Skills: A Cognitive Diagnosis Framework for Evaluating Financial...
Daily Paper Cast
FutureX: An Advanced Live Benchmark for LLM Agents in Future Prediction
Daily Paper Cast
MeshCoder: LLM-Powered Structured Mesh Code Generation from Point Clouds
Daily Paper Cast
Tinker: Diffusion's Gift to 3D--Multi-View Consistent Editing From Sparse Inputs...
Daily Paper Cast
Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation...
Daily Paper Cast
LongSplat: Robust Unposed 3D Gaussian Splatting for Casual Long Videos
Daily Paper Cast
Prompt Orchestration Markup Language
Daily Paper Cast
Ovis2.5 Technical Report
Daily Paper Cast
