Daily Paper Cast
Jingwen Liang, Gengyu Wang
We update every weekday to discuss highest-voted papers from Huggingface Daily Paper (https://huggingface.co/papers). Both the podcast scripts and audio are generated by AI. Feedback and suggestions are welcome! Email us: [email protected]:Jingwen Liang, 3D ML, https://www.linkedin.com/in/jingwen-liang/Gengyu Wang, LLM ML, http://wanggengyu.comListen on: Spotify: https://open.spotify.com/show/21nrhmdaA8qoBiH8q03NXLApple Podcast: https://podcasts.apple.com/us/podcast/daily-paper-...
Episodes (1777)
GigaBrain-0: A World Model-Powered Vision-Language-Action Model
Daily Paper Cast
LightMem: Lightweight and Efficient Memory-Augmented Generation
Daily Paper Cast
Efficient Long-context Language Model Training by Core Attention Disaggregation
Daily Paper Cast
World-in-World: World Models in a Closed-Loop World
Daily Paper Cast
UniGenBench++: A Unified Semantic Evaluation Benchmark for Text-to-Image Generat...
Daily Paper Cast
Chem-R: Learning to Reason as a Chemist
Daily Paper Cast
MoGA: Mixture-of-Groups Attention for End-to-End Long Video Generation
Daily Paper Cast
Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal...
Daily Paper Cast
Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking M...
Daily Paper Cast
IF-VidCap: Can Video Caption Models Follow Instructions?
Daily Paper Cast
DeepAnalyze: Agentic Large Language Models for Autonomous Data Science
Daily Paper Cast
PICABench: How Far Are We from Physically Realistic Image Editing?
Daily Paper Cast
Glyph: Scaling Context Windows via Visual-Text Compression
Daily Paper Cast
FineVision: Open Data Is All You Need
Daily Paper Cast
TrajSelector: Harnessing Latent Representations for Efficient and Effective Best...
Daily Paper Cast
Towards Mixed-Modal Retrieval for Universal Retrieval-Augmented Generation
Daily Paper Cast
When to Ensemble: Identifying Token-Level Points for Stable and Fast LLM Ensembl...
Daily Paper Cast
A Theoretical Study on Bridging Internal Probability and Self-Consistency for LL...
Daily Paper Cast
OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM
Daily Paper Cast
NANO3D: A Training-Free Approach for Efficient 3D Editing Without Masks
Daily Paper Cast
Emergent Misalignment via In-Context Learning: Narrow in-context examples can pr...
Daily Paper Cast
Scaling Instruction-Based Video Editing with a High-Quality Synthetic Dataset
Daily Paper Cast
Skyfall-GS: Synthesizing Immersive 3D Urban Scenes from Satellite Imagery
Daily Paper Cast
Latent Diffusion Model without Variational Autoencoder
Daily Paper Cast
When Models Lie, We Learn: Multilingual Span-Level Hallucination Detection with...
Daily Paper Cast
Agentic Entropy-Balanced Policy Optimization
Daily Paper Cast
WithAnyone: Towards Controllable and ID Consistent Image Generation
Daily Paper Cast
AI for Service: Proactive Assistance with AI Glasses
Daily Paper Cast
From Pixels to Words -- Towards Native Vision-Language Primitives at Scale
Daily Paper Cast
ImagerySearch: Adaptive Test-Time Search for Video Generation Beyond Semantic De...
Daily Paper Cast
Information Gain-based Policy Optimization: A Simple and Effective Approach for...
Daily Paper Cast
LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
Daily Paper Cast
TokDrift: When LLM Speaks in Subwords but Code Speaks in Grammar
Daily Paper Cast
BitNet Distillation
Daily Paper Cast
Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-a...
Daily Paper Cast
Advancing End-to-End Pixel Space Generative Modeling via Self-supervised Pre-tra...
Daily Paper Cast
DITING: A Multi-Agent Evaluation Framework for Benchmarking Web Novel Translatio...
Daily Paper Cast
Scaling Language-Centric Omnimodal Representation Learning
Daily Paper Cast
Robot Learning: A Tutorial
Daily Paper Cast
Detect Anything via Next Point Prediction
Daily Paper Cast
A Survey of Vibe Coding with Large Language Models
Daily Paper Cast
FlashVSR: Towards Real-Time Diffusion-Based Streaming Video Super-Resolution
Daily Paper Cast
Dr.LLM: Dynamic Layer Routing in LLMs
Daily Paper Cast
Temporal Alignment Guidance: On-Manifold Sampling in Diffusion Models
Daily Paper Cast
QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMs
Daily Paper Cast
Diffusion Transformers with Representation Autoencoders
Daily Paper Cast
OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs
Daily Paper Cast
Latent Refinement Decoding: Enhancing Diffusion-Based Language Models by Refinin...
Daily Paper Cast
Spotlight on Token Perception for Multimodal Reinforcement Learning
Daily Paper Cast
RLFR: Extending Reinforcement Learning for LLMs with Flow Environment
Daily Paper Cast
