Hugging Face 模型趋势榜和每日论文。
模型
排行第一:Audio8-ASR-Infinite(语音识别)
Hugging Face 趋势榜上的模型,任务类型是语音识别,点赞 1926,趋势分 1502。标签:audio8_asr_infinite、text-generation、streaming、realtime、speech-recognition。(点赞 1926 · 趋势分 1502)
在 Hugging Face 查看
排行第二:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4692,趋势分 1370。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4692 · 趋势分 1370)
在 Hugging Face 查看
排行第三:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1102,趋势分 874。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 1102 · 趋势分 874)
在 Hugging Face 查看
排行第四:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2587,趋势分 862。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2587 · 趋势分 862)
在 Hugging Face 查看
排行第五:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 574,趋势分 545。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 574 · 趋势分 545)
在 Hugging Face 查看
排行第六:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2725,趋势分 540。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2725 · 趋势分 540)
在 Hugging Face 查看
排行第七:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 565,趋势分 398。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 565 · 趋势分 398)
在 Hugging Face 查看
排行第八:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5737,趋势分 367。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5737 · 趋势分 367)
在 Hugging Face 查看
排行第九:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16662,趋势分 363。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16662 · 趋势分 363)
在 Hugging Face 查看
排行第十:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2308,趋势分 317。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2308 · 趋势分 317)
在 Hugging Face 查看
排行第十一:Julia-1(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 319,趋势分 309。标签:decision-model、multilingual、routing、base_model:jhu-clsp/mmBERT-small、base_model:finetune:jhu-clsp/mmBERT-small。(点赞 319 · 趋势分 309)
在 Hugging Face 查看
排行第十二:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 454,趋势分 306。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 454 · 趋势分 306)
在 Hugging Face 查看
论文
排行第一:CoEvoWhen:策略-工具协同进化实现超长视频时序定位
本文提出一种策略-工具协同进化框架,旨在解决超长视频时序定位中长距离证据搜索与细粒度事件理解的平衡问题。该方法基于视觉语言模型的智能推理轨迹,共同进化高层策略和可执行媒体工具,形成可重用技能而无需更新模型参数。通过外部技能更新器提炼长视频时序定位中的可迁移任务经验,优化基于图像的长距离和细粒度视频编排。
在 Hugging Face 查看
排行第二:RoboCoach:世界模型作为组合机器人技能的主动教练
本文提出ROBOCOACH框架,利用世界模型指导机器人技能的自改进。针对长视野操作任务中技能组合的优化成本高问题,该方法通过想象失败来引导演示请求和专家更新。其RIDI循环在共享动作条件世界模型COACHWORLD中执行可重用技能专家,并使用进度判断器记录首个失败的子任务。聚合记录选择需要获取演示的子任务,实现高效技能组合改进。(论文赞 1)
在 Hugging Face 查看
排行第三:更多选择更少决策:JEV类直接决策模型的序数尺度偏差
本文分析直接决策模型在序数尺度使用中的偏差问题。研究发现JEV等模型在ANLI任务中将大量预测和错误分配给中性类别,尽管准确率较高且标签平衡。在36个序数数据集中,最终决策仅使用67-76%的有效黄金支持,而名义任务达87-102%。随机化候选顺序会减弱但未消除偏差,揭示模型未忠实使用用户提供的序数决策尺度。(论文赞 3)
在 Hugging Face 查看
排行第四:EvoDuet:科学发现中网络搜索与任务解决的双层协同进化
本文提出EvoDuet方法,通过双层优化协同进化解决方案和搜索查询。当大语言模型进化搜索因缺乏外部知识停滞时,检索门让模型评估知识差距并选择检索新文档、重用存储文档或无文档继续。内循环根据预测解决方案得分优化查询和文档排序,外循环基于这些文档并行生成候选方案,避免传统网络搜索返回相同页面的问题。(论文赞 3)
在 Hugging Face 查看
排行第五:Game-Guided Skill Discovery:通过自博弈发现可玩代理控
本文提出GGSD框架,利用游戏自博弈发现可直接由人类操控的运动技能。可玩技能通过少量学习行为而非底层动作提供紧凑的具身代理控制抽象。该方法通过竞争性游戏实现技能发现,分层代理与过去自我对抗,高层策略从离散技能集中选择,低层策略执行技能。相比无监督方法,能同时实现语义区分、可解释和表达性等特性。(论文赞 2)
在 Hugging Face 查看
排行第六:系统探索GPT-6 Astra作为具身策略的能力
本文系统评估GPT-6 Astra作为通用具身策略的能力,涵盖六个领域测试直接控制、与学习策略协作及反馈驱动适应。在夹爪操作中,Astra能修正任务目标并为后续策略执行准备接触条件;与π0.5混合控制在RoboDojo子集达48%成功率。在灵巧操作中,混合控制在十次经验引导DexJoCo试验达50%成功率,而直接手内控制难以协调动作。
在 Hugging Face 查看
排行第七:EviRover: 超越一瞥的代理感知
传统视觉感知假设单次观察图像即可完成预测,但现实场景中常需更多细节或最新信息。本文提出将感知视为代理过程,可获取单次观察之外的信息,并设计了两个数据生成管道以支持训练。(论文赞 1)
在 Hugging Face 查看
排行第八:Physis-Lang: 物理语言的自我演化
视频世界模型常生成违背物理规律的视频。本文提出Physis-Lang框架,将物理语言作为共享可优化的表示,用于数据构建、模型训练和视频生成,以提升物理一致性。(论文赞 2)
在 Hugging Face 查看
排行第九:并非每个token都值得蒸馏
直接策略蒸馏(Direct-OPD)使用强化学习前后检查点的token级对数比作为学生模型的密集监督,但该方法可能在概率质量消失时仍保持奖励不变,导致训练不稳定。(论文赞 1)
在 Hugging Face 查看
排行第十:DC-SAE: 快速扩散收敛的深度压缩语义自编码器
高压缩分词器对潜空间图像生成模型至关重要,但激进压缩会降低重建保真度并减慢扩散训练速度。本文提出DC-SAE,通过预训练语义编码器提升潜在特征表达能力,实现高压缩与快速训练的平衡。(论文赞 2)
在 Hugging Face 查看
排行第十一:DuoOPD: 基于师生联合结果的多任务策略蒸馏
策略蒸馏(OPD)通常忽略教师和学生的成功结果,导致正确响应被错误惩罚。DuoOPD根据学生结果设定反馈方向,由师生联合结果决定教师支持方式,提升多任务学习效果。(论文赞 2)
在 Hugging Face 查看
排行第十二:教师是方向而非终点
策略蒸馏(OPD)通过匹配教师的下一个token分布训练学生,但强化学习对模型内部表示的改变在输出空间中被语言模型头部分削弱,导致训练不稳定。本文提出通过外推RL诱导的表示残差来改进。(论文赞 47)
在 Hugging Face 查看
