HF榜单(2026年10月07日 00:15 北京时间)


clef(图文理解)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1622,趋势分 1491。标签:qwen3_5、clef、cloudflare、systemone、qwen3.8。(点赞 1622 · 趋势分 1491)
在 Hugging Face 查看

排行第二:JEV-27B-VL(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 899,趋势分 724。标签:qwen3_5、jev、system-one、system-two、typed-decisions。(点赞 899 · 趋势分 724)
在 Hugging Face 查看

排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 3377,趋势分 684。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 3377 · 趋势分 684)
在 Hugging Face 查看

排行第四:Kolibri-1(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 690,趋势分 662。标签:vllm、kolibri1、reasoning、moe、conversational。(点赞 690 · 趋势分 662)
在 Hugging Face 查看

排行第五:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 5273,趋势分 573。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 5273 · 趋势分 573)
在 Hugging Face 查看

排行第六:clef-flash(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 574,趋势分 548。标签:qwen3_5、clef、cloudflare、systemone、qwen3.5。(点赞 574 · 趋势分 548)
在 Hugging Face 查看

排行第七:GEV-26B-Decide(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 666,趋势分 528。标签:gemma4、image-text-to-text、system-one、system-two、adaptive-thinking。(点赞 666 · 趋势分 528)
在 Hugging Face 查看

排行第八:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 6595,趋势分 499。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 6595 · 趋势分 499)
在 Hugging Face 查看

排行第九:Xing4.0-29B-A4B-GGUF(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 427,趋势分 404。标签:xing4_0、conversational、custom_code、base_model:XingChen-AGI/Xing4.0-29B-A4B、base_model:quantized:XingChen-AGI/Xing4.0-29B-A4B。(点赞 427 · 趋势分 404)
在 Hugging Face 查看

排行第十:humanizer(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 367,趋势分 359。标签:gemma4_unified、image-text-to-text、humanizer、text-rewriting、rewriting。(点赞 367 · 趋势分 359)
在 Hugging Face 查看

排行第十一:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 17089,趋势分 350。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 17089 · 趋势分 350)
在 Hugging Face 查看

排行第十二:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 3029,趋势分 265。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 3029 · 趋势分 265)
在 Hugging Face 查看

论文

排行第一:iADD:提升扩散策略优化的对齐性与多样性
本文研究基于强化学习的扩散模型后训练方法,如去噪扩散策略优化(DDPO),旨在在奖励函数下优化反向扩散过程。现有方法在优化奖励时往往牺牲了生成样本的多样性和质量。通过理论分析和算法设计,论文探讨了如何实现更好的权衡。理论分析表明,仅更新扩散模型后期时间步可能损害多样性,这与先前研究的结论相反。此外,论文提出了一种基于Feynman-Kac理论的增量训练方法,以提升性能。
在 Hugging Face 查看

排行第二:FairRSFM:遥感基础模型的生物群落感知基准与去偏框架
遥感基础模型(RSFM)通常使用聚合指标评估,但可能掩盖不同生态区域的性能差异。FairRSFM是一个生物群落感知的基准,用于评估RSFM的生态群体鲁棒性。它将来自14个陆地生物群落类的地理参考样本映射为6个生态宏观组,并在统一的冻结骨干评估协议下测试模型。基准覆盖四个下游数据集,并利用多个模型进行实验,显示聚合性能的一致性。(论文赞 1)
在 Hugging Face 查看

排行第三:Video2Skill:从流式经验到可重用的具身技能
操纵行为因物体和场景而异,但共享少量可重用技能。规划这些技能有助于具身智能体泛化到新任务。然而,智能体只能使用已知技能。从观察经验中恢复技能(即规划的反向过程)可积累知识并为训练提供数据。视觉语言模型(VLM)能描述单个操纵事件,但能否将事件流组织成可重用技能?论文将问题形式化为流式具身技能发现(SESD),模型按序观看视频并维护技能库以指导后续决策。(论文赞 4)
在 Hugging Face 查看

排行第四:ProgressCompass:具身进度奖励模型依赖上下文
具身智能体执行长任务时,仅知最终成败无法反映过程进展。进度奖励模型(PRM)在每一步评分任务进度,用作密集奖励、验证器和监控器。但在长任务中,当前帧常不足以判断进度,因为进展依赖先前事件,这称为上下文依赖的进度估计问题。现有基准多关注短任务,其进度可从当前观察读出,而PRM在需要上下文时的能力尚未充分探索。论文旨在填补这一空白。(论文赞 4)
在 Hugging Face 查看

排行第五:Foresight:无需重训练规划流式VLM的未来感知
现有流式视觉语言模型(VLM)持续感知和推理视觉流,但其计算路径在推理中固定,无法适应动态场景,其中不同事件需不同感知水平。论文表明流式VLM固有地能预测近期未来,并利用此能力以无需训练的方式动态配置未来计算。实现这种预见性计算面临挑战:未来预测需足够可靠以指导计算,规划须与流处理并发运行。论文探讨了相关方法。
在 Hugging Face 查看

排行第六:DeskForge:从桌面环境为计算机使用智能体提供密集监督
计算机使用智能体需在复杂桌面场景中可靠地定位动作目标,其中多应用、重叠窗口和相似控件竞争注意力。现有训练数据很少提供密集标注或受控变化。DeskForge是一个可控桌面环境,通过组合真实应用生成大规模监督数据。它变化应用状态、内容、窗口布局、外观和分辨率,并融合截图、可访问性树和窗口几何信息为密集元素标注,同时记录动作结果。利用此环境可训练智能体处理桌面交互。(论文赞 5)
在 Hugging Face 查看

排行第七:MM-ABC:迈向通用移动操纵的感知、协调与想象方法
移动操纵通过可控可达区域扩展机器人交互,面临连续自我运动下的空间感知和异构手臂-底座动作协调挑战。现有方法常分离移动与操纵,本文提出MM-ABC基础模型,围绕感知、协调和想象,旨在通过支持跨流协作的表示实现通用移动操纵。(论文赞 1)
在 Hugging Face 查看

排行第八:LMBuild:评估大语言模型代理生成可建造及功能结构的能力
基于LLM的代理能生成复杂3D结构,但现有评估多关注几何质量,忽视物理可实现性和功能。本文引入LMBuild基准,将生成对象表示为含零件分解、关节、材料和序列的组装结构,评估LLM代理生成可建造且有功能结构的能力,提供统一工具支持可重复评价。(论文赞 19)
在 Hugging Face 查看

排行第九:适配先验数据拟合网络用于表格异常检测
深度特征在图像视频异常检测中效果显著,但在表格数据中影响有限,部分因缺乏强深度表示。近期先验数据拟合网络(PFNs)成为表格数据有前景的表示来源,本文研究如何适配PFN表示用于异常检测,指出部署前无异常数据、参考集可能含异常等问题,开展相关探索。(论文赞 1)
在 Hugging Face 查看

排行第十:经验变分自编码器
本文提出经验变分自编码器(EVA),一种连续值序列的通用生成框架。EVA基于VAE的证据下界,通过额外线性层从训练数据中经验学习自回归潜在先验,取代传统标准高斯约束,显著减轻先验与后验的潜在分布差距,实现高保真的序列生成 ancestral采样,实验表现良好。(论文赞 1)
在 Hugging Face 查看

排行第十一:MEA:面向忠实模型解释的奖励驱动多代理系统
高风险领域的ML模型常不透明,后验解释方法需专业知识,领域专家常缺乏。本文提出MEA多代理框架:Proposer代理根据问题和模态选择配置解释工具,Actor代理端到端优化生成忠实解释,移除解释知识壁垒,帮助领域专家理解模型行为。
在 Hugging Face 查看

排行第十二:GeoCR:从异质观测中学习通用云去除先验
云去除方法常专用于特定数据集和输入配置,跨传感器、光谱带等复用性有限。本文引入GeoCR通用模型,统一单/多时态多云观测的RGB仅基云和多光谱云去除(可选SAR指导),通过紧凑茎扩展预训练RGB自编码器,共享潜在接口使单流变压器联合建模清洁潜变量,条件于不同多云观测。(论文赞 2)
在 Hugging Face 查看



扫描二维码,在手机上阅读

热榜(2026年10月07日 00:15 北京时间)

HN榜单(2026年10月07日 00:15 北京时间)

评 论
评论已关闭