HF榜单(2026年09月30日 18:45 北京时间)


laya(文本分类)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4574,趋势分 1596。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4574 · 趋势分 1596)
在 Hugging Face 查看

排行第二:Audio8-ASR-Infinite(语音识别)
Hugging Face 趋势榜上的模型,任务类型是语音识别,点赞 1561,趋势分 1368。标签:audio8_asr_infinite、text-generation、streaming、realtime、speech-recognition。(点赞 1561 · 趋势分 1368)
在 Hugging Face 查看

排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2483,趋势分 952。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2483 · 趋势分 952)
在 Hugging Face 查看

排行第四:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 945,趋势分 808。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 945 · 趋势分 808)
在 Hugging Face 查看

排行第五:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2686,趋势分 636。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2686 · 趋势分 636)
在 Hugging Face 查看

排行第六:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 545,趋势分 536。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 545 · 趋势分 536)
在 Hugging Face 查看

排行第七:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 534,趋势分 514。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 534 · 趋势分 514)
在 Hugging Face 查看

排行第八:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16602,趋势分 357。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16602 · 趋势分 357)
在 Hugging Face 查看

排行第九:ZDTaichu5.0-9B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 2095,趋势分 356。标签:zdtaichu5_0、multimodal、vision-language-model、spatial-reasoning、agent。(点赞 2095 · 趋势分 356)
在 Hugging Face 查看

排行第十:Xing4.0-29B-A4B(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 1810,趋势分 354。标签:xing4_0、conversational、custom_code。(点赞 1810 · 趋势分 354)
在 Hugging Face 查看

排行第十一:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 437,趋势分 350。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 437 · 趋势分 350)
在 Hugging Face 查看

排行第十二:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5603,趋势分 347。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5603 · 趋势分 347)
在 Hugging Face 查看

论文

排行第一:APM-Bench:跨会话持久内存基准测试
为实现真实世界的个人助手,流式视频模型需要保留过去经验的持久内存。现有基准和方法多关注连续视频或短片段,忽略了现实交互的间歇性特点。APM-Bench将现实流式交互重构为多会话生活轨迹,包含549个会话、104条轨迹和2719个候选问题,涵盖客观和开放式问题。每个会话为带细粒度标注的视频,轨迹内会话围绕特定主题展开。(论文赞 10)
在 Hugging Face 查看

排行第二:基于图像生成的推理机制
链式思维推理革新了自然语言处理,使大语言模型能分解问题再回答。但仅限文本域的推理在需要直接操作视觉表示的任务中存在局限。现有方法通过外部视觉专家工具增强多模态大模型,但受限于狭窄刚性的操作。ReImaGin提出利用图像生成模型作为灵活的视觉推理机制,使多模态大模型能更自由地生成和变换视觉内容。(论文赞 7)
在 Hugging Face 查看

排行第三:WISE-ATTA:预算内主动测试时适应
主动测试时适应(ATTA)通过在推理时选择性查询监督来提升分布偏移下的鲁棒性。现有方法假设可为每个测试批次请求标签,但长期测试流中成本过高。本文提出预算ATTA,标签仅对部分测试批次可用。这将核心挑战从批次内决定标签对象转为时间上决定监督时机。WISE-ATTA提出一种预算感知方法,分配监督资源以优化适应效果。(论文赞 1)
在 Hugging Face 查看

排行第四:LLMs作为通用异步代理
现代大语言模型日益具备自主代理能力,但通常遵循顺序交互循环:读取、思考、回复或调用工具,重复进行。许多现实用例并非顺序的:语音助手、具身代理和监控系统在思考或执行任务时接收新输入。现代大语言模型通过专用架构处理语音交互和视频流,VLAs用于机器人控制,异步工具调用用于API使用。本文从不同异步任务中抽象出通用异步代理,能适应不同并发类型。(论文赞 19)
在 Hugging Face 查看

排行第五:持久性强制:像素空间扩散中的特征专化
像素空间扩散Transformer直接操作高维视觉数据,但其隐藏表示通常在深度上进行统一精炼。自然图像在不同粒度水平上具有内在组织。全局结构通常可紧凑表示,而局部纹理和细节需要更丰富的表示。受此启发,我们引入像素空间DiT中的异质精炼,为不同特征组分配不同的精炼预算。由此产生有序的特征专化:稀疏精炼的特征主要编码全局视觉结构,而更频繁精炼的特征则编码局部细节。(论文赞 2)
在 Hugging Face 查看

排行第六:代理的水平与垂直主动性
使用工具的代理通常响应用户明确请求,但完成任务可能需要用户未请求的信息。现有主动代理研究主要关注代理是否以及何时自主行动,而非应追求何种信息。我们研究主动性的一个不同维度:其内容。水平主动性追求当前上下文已识别的未陈述信息,垂直主动性追求仅早期证据揭示的需求。需要图从基准自身分解中恢复,记录哪些需求依赖于哪些,因此两种主动性及代理是否在正确时间停止均可从对话记录中评分。(论文赞 6)
在 Hugging Face 查看

排行第七:SEAD: 工具使用智能体的攻防状态视角
本文提出SEAD框架,从状态控制角度分析语言模型代理在使用工具时的攻击与防御问题。攻击者通过指令引导代理执行有害操作,而防御者需在执行前做出决策。DART方法将有害目标分解为局部合理的步骤,并利用工具执行反馈引导轨迹搜索,以应对部分可观测的状态变化。(论文赞 1)
在 Hugging Face 查看

排行第八:自然语言自动编码器中信息量最大的词元选择
研究如何在自然语言自动编码器中选择最具信息量的词元位置进行解释。通过分析470万个关于提示注入和隐藏的解释,比较了模型计算信号与仅基于聊天结构的排序器。结果表明,聊天结构通常能更有效地选择相关解释,且无需模型前向传播即可完成位置选择。(论文赞 7)
在 Hugging Face 查看

排行第九:AnyStep-WAM: 预算对齐的蒸馏与自适应推理
提出AnyStep世界动作模型框架,用于可调预算的预测和场景依赖的计算分配。通过预算对齐的教师轨迹蒸馏训练区间条件流映射,使用显式冻结教师转移和共享低秩适配器,支持动作生成。该方法能根据任务敏感性调整生成精度与速度。(论文赞 2)
在 Hugging Face 查看

排行第十:StoryEngine: 基于状态的视频叙事框架
针对长视频叙事中连贯性与一致性难题,提出StoryEngine框架。该框架通过显式传播故事事件后果和维护视频世界状态,解决现有代理流水线缺乏状态传递机制的问题。通过分离状态管理与生成过程,提升叙事连贯性和视觉一致性。(论文赞 7)
在 Hugging Face 查看

排行第十一:Sys1Cal-v1数据集:概率校准的引入
介绍Sys1Cal-v1数据集,用于评估System One模型的概率校准能力。该数据集包含关于命题A的真假问题,其概率P(A)已知。每个项目通过Jev的三个原语——Noul、Choice和Score进行查询,旨在检验返回选项概率的数值准确性。
在 Hugging Face 查看

排行第十二:SoL-Refiner: 高分辨率视频的光速一步精炼
提出SoL-Refiner,一种单步视频精炼方法,将低分辨率模型输出转换为4K视频。该方法结合高分辨率持续训练、强化学习后训练和最终一步蒸馏。引入Refiner-Bench基准,评估不同视频生成器输出的精炼效果,解决传统多步精炼的采样瓶颈。(论文赞 15)
在 Hugging Face 查看



扫描二维码,在手机上阅读

中文科技热榜(2026年09月30日 18:45 北京时间)

Personal Agent抢入口,AI竞争新焦点

评 论
评论已关闭