HF榜单(2026年09月30日 21:45 北京时间)


laya(文本分类)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4594,趋势分 1524。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4594 · 趋势分 1524)
在 Hugging Face 查看

排行第二:Audio8-ASR-Infinite(语音识别)
Hugging Face 趋势榜上的模型,任务类型是语音识别,点赞 1579,趋势分 1377。标签:audio8_asr_infinite、text-generation、streaming、realtime、speech-recognition。(点赞 1579 · 趋势分 1377)
在 Hugging Face 查看

排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2497,趋势分 923。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2497 · 趋势分 923)
在 Hugging Face 查看

排行第四:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 978,趋势分 840。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 978 · 趋势分 840)
在 Hugging Face 查看

排行第五:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2689,趋势分 608。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2689 · 趋势分 608)
在 Hugging Face 查看

排行第六:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 551,趋势分 542。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 551 · 趋势分 542)
在 Hugging Face 查看

排行第七:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 539,趋势分 518。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 539 · 趋势分 518)
在 Hugging Face 查看

排行第八:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16609,趋势分 353。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16609 · 趋势分 353)
在 Hugging Face 查看

排行第九:Xing4.0-29B-A4B(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 1811,趋势分 353。标签:xing4_0、conversational、custom_code。(点赞 1811 · 趋势分 353)
在 Hugging Face 查看

排行第十:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2291,趋势分 345。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2291 · 趋势分 345)
在 Hugging Face 查看

排行第十一:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5621,趋势分 342。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5621 · 趋势分 342)
在 Hugging Face 查看

排行第十二:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 437,趋势分 334。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 437 · 趋势分 334)
在 Hugging Face 查看

论文

排行第一:PMOPD:多任务排序、循环和参数更新子空间保护
多教师在线策略蒸馏(MOPD)是一种流行的后训练范式,用于整合前沿语言模型的专门能力。现有的在线策略蒸馏(OPD)研究主要集中在单任务蒸馏的目标设计、蒸馏范围和教师信号构建上,而MOPD需要在共享参数中聚合多种能力,并解决由此产生的能力跷跷板问题,即在一个领域中提高能力会抑制从另一个领域获得的能力。受OPD独特更新几何的启发,我们发现不同任务的参数更新在MOPD过程中迅速集中在各自的低维子空间中。(论文赞 2)
在 Hugging Face 查看

排行第二:改进的分布扩散模型
分布扩散模型(DDMs)用通过评分规则目标训练的分布去噪器替代了传统的均值预测去噪器,学习 p(x_1 | x_t) 的随机近似而非其条件均值。然而,将DDMs扩展到现代图像生成场景面临两个障碍:(i)多粒子训练的开销随着粒子数量增加而增加,(ii)DDMs使用全局固定的评分规则超参数,导致在不同的采样预算下只能进行单一的权衡。我们通过将粒子扩展推迟到后期的Transformer层来缓解这些限制,并通过引入时间依赖的评分规则调度来解决超参数权衡问题。(论文赞 3)
在 Hugging Face 查看

排行第三:AutoRef:优化多参考图像生成的代理方法
最近的图像生成模型可以接受多个参考图像作为输入,并将它们组合成一张新图像。然而,多参考图像生成仍然具有挑战性:模型可能会遗漏或重复参考图像中的主体,或者生成的图像中多个主体显得不自然地粘贴在一起。近期的研究提出了图像生成代理,结合了图像生成模型、推理模型和一个可执行程序(称为“缰绳”),该程序规定了如何解释参考图像、如何生成图像、如何诊断输出以及如何选择最终图像。然而,在多参考生成中,参考图像扮演不同的角色,输出必须满足多个目标。(论文赞 8)
在 Hugging Face 查看

排行第四:构建心智:优化多模态推理的潜在视觉目标表示
潜在推理通过两阶段训练范式推进了多模态推理:(1)在监督微调(SFT)阶段,辅助图像被编码成潜在标记以教授视觉推理链,(2)在强化学习(RL)阶段,这些潜在标记通过奖励反馈进一步优化。本文识别了该框架在每个阶段的两个关键限制。首先,SFT阶段通常依赖现成的视觉编码器来编码辅助图像,生成的潜在表示可能与下游推理任务不完全对齐。其次,现有的RL方法仅通过确定性方式处理潜在组件。(论文赞 1)
在 Hugging Face 查看

排行第五:APM-Bench:跨会话持久内存的基准测试
为了作为现实世界的个人助手,流式视频模型需要持久内存来保留过去的体验以供后续使用。然而,现有的流式基准和方法通常关注连续的视频或短片段,忽略了现实世界互动往往是间歇性的,需要内存跨中断持久保存。为了解决这一问题,我们引入了APM-Bench,将现实世界的流式互动重新定义为多会话生活轨迹。该基准包含549个会话、104个轨迹和2,719个候选问题,涵盖了客观和开放性问题。每个会话都是带有细粒度注释的视频,同一轨迹内的会话围绕特定主题展开。(论文赞 16)
在 Hugging Face 查看

排行第六:利用图像生成进行推理
链式思维推理通过将问题分解为中间步骤,彻底改变了自然语言处理,使大型语言模型(LLMs)能够更好地解答问题。然而,将推理限制在文本域内对于需要直接操作视觉表示的任务存在局限性。近期的研究通过添加外部视觉专家工具(如深度估计或目标检测模块)来增强多模态LLMs,但这些工具仍然受限于狭窄、僵化的操作,无法灵活生成或转换视觉内容。我们提出了ReImaGin,利用图像生成模型作为多模态任务中的灵活视觉推理机制。(论文赞 8)
在 Hugging Face 查看

排行第七:WISE-ATTA:预算约束下何时请求标签
该研究针对预算约束下的主动测试时适应(ATTA)问题,提出WISE-ATTA方法。在测试过程中,模型只能在部分批次请求标签,因此需要决定何时申请监督信号。该方法通过预算感知策略分配监督资源,提升模型在分布偏移下的鲁棒性。(论文赞 2)
在 Hugging Face 查看

排行第八:大语言模型是通用异步代理
本文提出大语言模型可作为通用异步代理,突破传统顺序交互模式的限制。通过构建异步框架,使模型能同时处理多种并发任务,如语音助手、机器人控制等,提升其在复杂现实场景中的适应能力与效率。(论文赞 26)
在 Hugging Face 查看

排行第九:持久力强制:利用像素空间扩散中的特征专业化
该研究在像素空间扩散Transformer中引入异构细化机制,根据不同特征组分配不同的细化预算。通过这种方式,模型在不同深度上实现特征专业化,全局结构由稀疏细化特征编码,局部细节则由频繁细化特征表示。(论文赞 3)
在 Hugging Face 查看

排行第十:询问从未被请求的内容:代理的横向与纵向主动性
本文研究代理在工具使用中的主动性,区分横向和纵向两种主动性。横向主动性关注当前上下文中已识别但未被请求的信息,纵向主动性则关注早期证据揭示的潜在需求。通过需要图评估代理的决策时机与内容。(论文赞 15)
在 Hugging Face 查看

排行第十一:SEAD:基于状态的工具使用代理攻击与防御
本文将工具使用代理的攻击与防御建模为部分可观测状态控制问题,提出SEAD框架。攻击者通过指令诱导有害行为,防御者需在执行前基于状态判断并阻止潜在威胁,提升代理系统的安全性。(论文赞 2)
在 Hugging Face 查看

排行第十二:自然语言自编码器中选择最有信息量的词元
该研究探讨自然语言自编码器中如何选择最有信息量的词元进行解释。通过分析470万解释样本,发现基于聊天结构的排序器比计算信号更有效,仅解释5%的词元即可保留近100%的解释成功率。(论文赞 9)
在 Hugging Face 查看



扫描二维码,在手机上阅读

中文科技热榜(2026年09月30日 21:45 北京时间)

X榜单(2026年09月30日 21:54 北京时间)

评 论
评论已关闭