Hugging Face 模型趋势榜和每日论文。
模型
排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4558,趋势分 1620。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4558 · 趋势分 1620)
在 Hugging Face 查看
排行第二:Audio8-ASR-Infinite(语音识别)
Hugging Face 趋势榜上的模型,任务类型是语音识别,点赞 1559,趋势分 1368。标签:audio8_asr_infinite、text-generation、streaming、realtime、speech-recognition。(点赞 1559 · 趋势分 1368)
在 Hugging Face 查看
排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2474,趋势分 969。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2474 · 趋势分 969)
在 Hugging Face 查看
排行第四:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 928,趋势分 791。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 928 · 趋势分 791)
在 Hugging Face 查看
排行第五:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2680,趋势分 656。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2680 · 趋势分 656)
在 Hugging Face 查看
排行第六:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 540,趋势分 531。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 540 · 趋势分 531)
在 Hugging Face 查看
排行第七:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 527,趋势分 507。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 527 · 趋势分 507)
在 Hugging Face 查看
排行第八:ZDTaichu5.0-9B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 2063,趋势分 394。标签:zdtaichu5_0、multimodal、vision-language-model、spatial-reasoning、agent。(点赞 2063 · 趋势分 394)
在 Hugging Face 查看
排行第九:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 435,趋势分 360。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 435 · 趋势分 360)
在 Hugging Face 查看
排行第十:Xing4.0-29B-A4B(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 1810,趋势分 355。标签:xing4_0、conversational、custom_code。(点赞 1810 · 趋势分 355)
在 Hugging Face 查看
排行第十一:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16591,趋势分 352。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16591 · 趋势分 352)
在 Hugging Face 查看
排行第十二:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5600,趋势分 349。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5600 · 趋势分 349)
在 Hugging Face 查看
论文
排行第一:持久性强制:利用像素空间扩散中的特征专化
本文提出一种在像素空间扩散Transformer(DiT)中实现异质精炼的方法。自然图像具有多粒度结构,全局结构可紧凑表示,而局部纹理需更丰富特征。通过为不同特征组分配不同深度精炼预算,促使特征专化:稀疏精炼特征主要编码全局视觉结构,频繁精炼特征处理细节。该方法旨在提升DiT对图像层次化信息的建模效率。(论文赞 2)
在 Hugging Face 查看
排行第二:主动性的内容:横向与纵向未请求信息获取
研究智能体在使用工具时的主动性内容维度。传统工作关注是否及何时主动行动,本文则探讨应获取哪些未陈述信息。提出横向主动性(基于当前上下文识别未明信息)和纵向主动性(基于早期证据揭示潜在需求),并通过需求图从任务分解中量化评估。该方法从交互记录中评分两种主动性及行动终止时机。(论文赞 1)
在 Hugging Face 查看
排行第三:SEAD:基于状态视角的工具使用智能体攻防
针对语言模型智能体使用工具时的安全问题,提出SEAD框架将攻防建模为部分可观测状态控制。因早期动作可能改变系统状态(如文件、权限),使后续常规动作具有危害性。攻击者DART将有害目标分解为局部合理步骤,利用工具执行反馈引导轨迹搜索;防御者需在执行前基于有限可见性判断动作安全性。(论文赞 1)
在 Hugging Face 查看
排行第四:自然语言自编码器中最具信息量词位选择
研究自然语言自编码器中解释性词位的选择策略。通过470万条提示注入和隐藏任务的解释数据,比较基于模型计算的信号与仅依赖对话结构的排序器效果。发现对话结构通常能更有效选择相关解释位点,且无需前向传播计算。在四分之三数据集中,仅解释5%词位即可保持接近全位点解释的成功率。(论文赞 6)
在 Hugging Face 查看
排行第五:AnyStep-WAM:预算对齐蒸馏与自适应推理
提出AnyStep世界动作模型框架,解决动作生成中计算资源分配问题。针对操作任务中动作块对生成误差的敏感度差异(关键动作需精确,次要动作可快速生成),采用预算对齐的教师轨迹蒸馏技术。通过区间条件流映射和共享低秩适配器,支持可变去噪步长的动作生成,实现场景自适应的计算分配。(论文赞 1)
在 Hugging Face 查看
排行第六:StoryEngine:基于状态锚定的视频叙事框架
为解决长视频叙事中的连贯性与一致性难题,提出StoryEngine智能体框架。现有方法依赖文本分镜或已生成像素,缺乏对故事事件后果的显式传播机制。本框架建立独立的世界状态表示,跨镜头追踪事件影响,避免视觉细节错误重构和漂移问题,旨在提升多镜头视频生成的叙事逻辑与视觉稳定性。(论文赞 7)
在 Hugging Face 查看
排行第七:Sys1Cal-v1数据集用于概率校准
本文提出Sys1Cal-v1数据集,用于评估系统一模型的概率校准能力。该数据集包含已知准确概率的真假问题,通过Noul、Choice和Score三种原语测试模型输出概率的准确性,以验证其概率是否具有正确的数值意义。
在 Hugging Face 查看
排行第八:SoL-Refiner:高速视频一步精修
本文提出SoL-Refiner,一种单步视频精修方法,可将低分辨率视频输出通过一次去噪步骤转化为4K视频。该方法结合高分辨率持续训练、强化学习后训练和单步蒸馏,有效解决多步精修带来的采样瓶颈问题。(论文赞 12)
在 Hugging Face 查看
排行第九:SplitMoE:视频扩散模型的分治专家架构
本文提出SplitMoE,一种分角色稀疏架构,解决传统混合专家模型在视频生成中因均匀性约束导致的路由碎片化问题。通过分离专家角色,提升对时空冗余和语义长尾数据的建模能力,实现更高效的视频生成。(论文赞 1)
在 Hugging Face 查看
排行第十:StructRL:结构化在线强化学习
本文提出StructRL,一种在线强化学习框架,用于长时程视觉-语言-动作任务。通过将任务分解为可验证的子任务,构建结构化中间监督,解决终端奖励稀疏的问题,提升策略在多步操作中的表现。(论文赞 1)
在 Hugging Face 查看
排行第十一:VoxPolyMem:多对话交互记忆框架
本文提出VoxPolyMem,一种交互感知的多模态记忆框架,用于多参与方语音对话的长期记忆。该框架结合增量说话人识别和记忆层次结构,支持对话内容保存、参与者识别和对话关系维护。(论文赞 29)
在 Hugging Face 查看
排行第十二:EmoRES-TTS:情感语音生成的残差增强向量引导
本文研究向量引导方法,用于情感语音合成。提出EmoRES-TTS,通过分解情感向量中的共享成分和特定成分,增强对目标情感的控制能力,提升情感表达的准确性和可控性。(论文赞 4)
在 Hugging Face 查看
