Daily Paper Cast

Daily Paper Cast

Informazioni

We update every weekday to discuss highest-voted papers from Huggingface Daily Paper (https://huggingface.co/papers). Both the podcast scripts and audio are generated by AI. Feedback and suggestions are welcome! Email us: [email protected] Creator: Jingwen Liang, 3D ML, https://www.linkedin.com/in/jingwen-liang/ Gengyu Wang, LLM ML, http://wanggengyu.com Listen on: Spotify: https://open.spotify.com/show/21nrhmdaA8qoBiH8q03NXL Apple Podcast: https://podcasts.apple.com/us/podcast/daily-paper-cast/id1777620236 Cover Image by Kawen Kuang https://kawen.art
1453
Episodi
English
Lingua
0
Iscritti
0
Ascolti
Episodi25
TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Flows

TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Flows

Dec 8, 2025·

🤗 Upvotes: 47 | cs.CV Authors: Zhenglin Cheng, Peng Sun, Jianguo Li, Tao Lin Title: TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Flows Arxiv: Abstract: Recent advances in large...

EditThinker: Unlocking Iterative Reasoning for Any Image Editor

EditThinker: Unlocking Iterative Reasoning for Any Image Editor

Dec 8, 2025·

🤗 Upvotes: 32 | cs.CV Authors: Hongyu Li, Manyuan Zhang, Dian Zheng, Ziyu Guo, Yimeng Jia, Kaituo Feng, Hao Yu, Yexin Liu, Yan Feng, Peng Pei, Xunliang Cai, Linjiang Huang, Hongsheng Li, Si Liu Title: EditThinker...

From Imitation to Discrimination: Toward A Generalized Curriculum Advantage Mechanism Enhancing Cross-Domain Reasoning Tasks

From Imitation to Discrimination: Toward A Generalized Curriculum Advantage Mechanism Enhancing Cross-Domain Reasoning Tasks

Dec 8, 2025·

🤗 Upvotes: 25 | cs.CL Authors: Changpeng Yang, Jinyang Wu, Yuchen Liu, Shuai Zhang, Yang Li, Qiliang Liang, Hongzhen Wang, Shuai Nie, Jiaming Xu, Runyu Shi, Ying Huang, Guoquan Zhang Title: From Imitation to...

EMMA: Efficient Multimodal Understanding, Generation, and Editing with a Unified Architecture

EMMA: Efficient Multimodal Understanding, Generation, and Editing with a Unified Architecture

Dec 8, 2025·

🤗 Upvotes: 22 | cs.CV Authors: Xin He, Longhui Wei, Jianbo Ouyang, Lingxi Xie, Qi Tian Title: EMMA: Efficient Multimodal Understanding, Generation, and Editing with a Unified Architecture Arxiv: Abstract: We propose...

DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle

DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle

Dec 5, 2025·

🤗 Upvotes: 120 | cs.CL, cs.AI Authors: Fangyu Lei, Jinxiang Meng, Yiming Huang, Junjie Zhao, Yitong Zhang, Jianwen Luo, Xin Zou, Ruiyi Yang, Wenbo Shi, Yan Gao, Shizhu He, Zuo Wang, Qian Liu, Yang Wang, Ke Wang, Jun...

Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length

Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length

Dec 5, 2025·

🤗 Upvotes: 113 | cs.CV Authors: Yubo Huang, Hailong Guo, Fangtai Wu, Shifeng Zhang, Shijie Huang, Qijun Gan, Lin Liu, Sirui Zhao, Enhong Chen, Jiaming Liu, Steven Hoi Title: Live Avatar: Streaming Real-time...

Nex-N1: Agentic Models Trained via a Unified Ecosystem for Large-Scale Environment Construction

Nex-N1: Agentic Models Trained via a Unified Ecosystem for Large-Scale Environment Construction

Dec 5, 2025·

🤗 Upvotes: 58 | cs.CL Authors: Nex-AGI Team,:, Yuxuan Cai, Lu Chen, Qiaoling Chen, Yuyang Ding, Liwen Fan, Wenjie Fu, Yufei Gao, Honglin Guo, Pinxue Guo, Zhenhua Han, Zhengfu He, Hanglei Hu, Kai Hu, Shengjia Hua...

ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning

ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning

Dec 5, 2025·

🤗 Upvotes: 35 | cs.CV Authors: Shengyuan Ding, Xinyu Fang, Ziyu Liu, Yuhang Zang, Yuhang Cao, Xiangyu Zhao, Haodong Duan, Xiaoyi Dong, Jianze Liang, Bin Wang, Conghui He, Dahua Lin, Jiaqi Wang Title: ARM-Thinker...

Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation

Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation

Dec 5, 2025·

🤗 Upvotes: 31 | cs.CV Authors: Yunhong Lu, Yanhong Zeng, Haobo Li, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Jiapeng Zhu, Hengyuan Cao, Zhipeng Zhang, Xing Zhu, Yujun Shen, Min Zhang Title: Reward Forcing: Efficient...

Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous Latent Diffusion

Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous Latent Diffusion

Dec 5, 2025·

🤗 Upvotes: 26 | cs.CV Authors: Yueming Pan, Ruoyu Feng, Qi Dai, Yuqi Wang, Wenfeng Lin, Mingyu Guo, Chong Luo, Nanning Zheng Title: Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous...

PaperDebugger: A Plugin-Based Multi-Agent System for In-Editor Academic Writing, Review, and Editing

PaperDebugger: A Plugin-Based Multi-Agent System for In-Editor Academic Writing, Review, and Editing

Dec 5, 2025·

🤗 Upvotes: 23 | cs.AI, cs.SE Authors: Junyi Hou, Andre Lin Huikai, Nuo Chen, Yiwei Gong, Bingsheng He Title: PaperDebugger: A Plugin-Based Multi-Agent System for In-Editor Academic Writing, Review, and Editing Arxiv...

Qwen3-VL Technical Report

Qwen3-VL Technical Report

Dec 4, 2025·

🤗 Upvotes: 91 | cs.CV, cs.AI Authors: Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, Wenbin Ge, Zhifang Guo, Qidong Huang, Jie Huang, Fei...

Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach

Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach

Dec 4, 2025·

🤗 Upvotes: 33 | cs.RO, cs.AI Authors: Siyuan Yang, Yang Zhang, Haoran He, Ling Pan, Xiu Li, Chenjia Bai, Xuelong Li Title: Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach Arxiv...

PretrainZero: Reinforcement Active Pretraining

PretrainZero: Reinforcement Active Pretraining

Dec 4, 2025·

🤗 Upvotes: 31 | cs.CL Authors: Xingrun Xing, Zhiyuan Fan, Jie Lou, Guoqi Li, Jiajun Zhang, Debing Zhang Title: PretrainZero: Reinforcement Active Pretraining Arxiv: Abstract: Mimicking human behavior to actively...

ViDiC: Video Difference Captioning

ViDiC: Video Difference Captioning

Dec 4, 2025·

🤗 Upvotes: 24 | cs.CV Authors: Jiangtao Wu, Shihao Li, Zhaozhou Bian, Yuanxing Zhang, Jialu Chen, Runzhe Wen, An Ping, Yiwen He, Jiakai Wang, Jiaheng Liu Title: ViDiC: Video Difference Captioning Arxiv: Abstract...

DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models

DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models

Dec 3, 2025·

🤗 Upvotes: 114 | cs.CL Authors: DeepSeek-AI, Aixin Liu, Aoxue Mei, Bangcai Lin, Bing Xue, Bingxuan Wang, Bingzheng Xu, Bochao Wu, Bowei Zhang, Chaofan Lin, Chen Dong, Chengda Lu, Chenggang Zhao, Chengqi Deng, Chenhao...

ToolOrchestra: Elevating Intelligence via Efficient Model and Tool Orchestration

ToolOrchestra: Elevating Intelligence via Efficient Model and Tool Orchestration

Dec 3, 2025·

🤗 Upvotes: 63 | cs.CL, cs.AI, cs.LG, cs.MA Authors: Hongjin Su, Shizhe Diao, Ximing Lu, Mingjie Liu, Jiacheng Xu, Xin Dong, Yonggan Fu, Peter Belcak, Hanrong Ye, Hongxu Yin, Yi Dong, Evelina Bakhturina, Tao Yu, Yejin...

MultiShotMaster: A Controllable Multi-Shot Video Generation Framework

MultiShotMaster: A Controllable Multi-Shot Video Generation Framework

Dec 3, 2025·

🤗 Upvotes: 50 | cs.CV Authors: Qinghe Wang, Xiaoyu Shi, Baolu Li, Weikang Bian, Quande Liu, Huchuan Lu, Xintao Wang, Pengfei Wan, Kun Gai, Xu Jia Title: MultiShotMaster: A Controllable Multi-Shot Video Generation...

MG-Nav: Dual-Scale Visual Navigation via Sparse Spatial Memory

MG-Nav: Dual-Scale Visual Navigation via Sparse Spatial Memory

Dec 3, 2025·

🤗 Upvotes: 44 | cs.CV, cs.RO Authors: Bo Wang, Jiehong Lin, Chenzhi Liu, Xinting Hu, Yifei Yu, Tianjia Liu, Zhongrui Wang, Xiaojuan Qi Title: MG-Nav: Dual-Scale Visual Navigation via Sparse Spatial Memory Arxiv...

Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinking with Images and DeepResearch

Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinking with Images and DeepResearch

Dec 3, 2025·

🤗 Upvotes: 38 | cs.CV Authors: Yifan Zhang, Liang Hu, Haofeng Sun, Peiyu Wang, Yichen Wei, Shukang Yin, Jiangbo Pei, Wei Shen, Peng Xia, Yi Peng, Tianyidan Xie, Eric Li, Yang Liu, Xuchen Song, Yahui Zhou Title...

DualCamCtrl: Dual-Branch Diffusion Model for Geometry-Aware Camera-Controlled Video Generation

DualCamCtrl: Dual-Branch Diffusion Model for Geometry-Aware Camera-Controlled Video Generation

Dec 3, 2025·

🤗 Upvotes: 38 | cs.CV Authors: Hongfei Zhang, Kanghao Chen, Zixin Zhang, Harold Haodong Chen, Yuanhuiyi Lyu, Yuqi Zhang, Shuai Yang, Kun Zhou, Yingcong Chen Title: DualCamCtrl: Dual-Branch Diffusion Model for...

Guided Self-Evolving LLMs with Minimal Human Supervision

Guided Self-Evolving LLMs with Minimal Human Supervision

Dec 3, 2025·

🤗 Upvotes: 37 | cs.AI, cs.CL, cs.LG Authors: Wenhao Yu, Zhenwen Liang, Chengsong Huang, Kishan Panaganti, Tianqing Fang, Haitao Mi, Dong Yu Title: Guided Self-Evolving LLMs with Minimal Human Supervision Arxiv...

SimScale: Learning to Drive via Real-World Simulation at Scale

SimScale: Learning to Drive via Real-World Simulation at Scale

Dec 3, 2025·

🤗 Upvotes: 33 | cs.CV, cs.RO Authors: Haochen Tian, Tianyu Li, Haochen Liu, Jiazhi Yang, Yihang Qiu, Guang Li, Junli Wang, Yinfeng Gao, Zhang Zhang, Liang Wang, Hangjun Ye, Tieniu Tan, Long Chen, Hongyang Li Title...

InnoGym: Benchmarking the Innovation Potential of AI Agents

InnoGym: Benchmarking the Innovation Potential of AI Agents

Dec 3, 2025·

🤗 Upvotes: 30 | cs.CL, cs.AI, cs.CV, cs.LG, cs.MA Authors: Jintian Zhang, Kewei Xu, Jingsheng Zheng, Zhuoyun Yu, Yuqi Zhu, Yujie Luo, Lanning Wei, Shuofei Qiao, Lun Du, Da Zheng, Shumin Deng, Huajun Chen, Ningyu Zhang...

LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling

LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling

Dec 2, 2025·

🤗 Upvotes: 140 | cs.CV Authors: Zuhao Yang, Sudong Wang, Kaichen Zhang, Keming Wu, Sicong Leng, Yifan Zhang, Chengwei Qin, Shijian Lu, Xingxuan Li, Lidong Bing Title: LongVT: Incentivizing "Thinking with Long Videos"...

Potrebbe piacerti anche