HF榜单(2026年10月07日 01:45 北京时间)


clef(图文理解)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1640,趋势分 1508。标签:qwen3_5、clef、cloudflare、systemone、qwen3.8。(点赞 1640 · 趋势分 1508)
在 Hugging Face 查看

排行第二:JEV-27B-VL(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 922,趋势分 743。标签:qwen3_5、jev、system-one、system-two、typed-decisions。(点赞 922 · 趋势分 743)
在 Hugging Face 查看

排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 3396,趋势分 691。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 3396 · 趋势分 691)
在 Hugging Face 查看

排行第四:Kolibri-1(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 694,趋势分 666。标签:vllm、kolibri1、reasoning、moe、conversational。(点赞 694 · 趋势分 666)
在 Hugging Face 查看

排行第五:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 5275,趋势分 557。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 5275 · 趋势分 557)
在 Hugging Face 查看

排行第六:clef-flash(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 576,趋势分 550。标签:qwen3_5、clef、cloudflare、systemone、qwen3.5。(点赞 576 · 趋势分 550)
在 Hugging Face 查看

排行第七:GEV-26B-Decide(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 666,趋势分 528。标签:gemma4、image-text-to-text、system-one、system-two、adaptive-thinking。(点赞 666 · 趋势分 528)
在 Hugging Face 查看

排行第八:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 6614,趋势分 505。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 6614 · 趋势分 505)
在 Hugging Face 查看

排行第九:Xing4.0-29B-A4B-GGUF(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 434,趋势分 411。标签:xing4_0、conversational、custom_code、base_model:XingChen-AGI/Xing4.0-29B-A4B、base_model:quantized:XingChen-AGI/Xing4.0-29B-A4B。(点赞 434 · 趋势分 411)
在 Hugging Face 查看

排行第十:humanizer(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 372,趋势分 364。标签:gemma4_unified、image-text-to-text、humanizer、text-rewriting、rewriting。(点赞 372 · 趋势分 364)
在 Hugging Face 查看

排行第十一:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 17095,趋势分 345。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 17095 · 趋势分 345)
在 Hugging Face 查看

排行第十二:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 3031,趋势分 264。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 3031 · 趋势分 264)
在 Hugging Face 查看

论文

排行第一:超越语义相似性:复杂任务中智能检索的性能与成本
本文研究智能检索方法,将大型语言模型的推理能力与检索器的高效语料库探索相结合,通过ReAct智能循环解决复杂检索任务。实验表明,相比标准检索,智能检索更有效,使用相同嵌入模型时nDCG@10提升8.7点。该方法克服了仅依赖表层语义相似性的局限,适用于日益复杂的搜索应用。(论文赞 1)
在 Hugging Face 查看

排行第二:COSMI:多对象交互的组合合成方法
本文提出COSMI方法,通过组合单对象交互片段生成多对象人体交互模型。由于多对象捕捉成本高,该方法利用单对象捕获数据,通过接触一致剪辑、镜像平衡手部动作、身体间转移,并结合语言模型和几何检查确保语义和物理合理性。从而以组合方式扩展数据集,避免耗时录制。(论文赞 2)
在 Hugging Face 查看

排行第三:学习蛋白质潜在语言用于自回归生成
研究蛋白质序列和结构生成中目标表示的作用,引入两种学习到的潜在蛋白质语言。蛋白质潜在语言(PLL)将序列映射到基于冻结ESM-2编码器的4,096状态上下文字母表,每个残基对应一个标记。结构潜在语言(SLL)适配GCP-VQVAE Lite,保留骨架坐标解码。分别预训练自回归变换器以改进生成能力。(论文赞 1)
在 Hugging Face 查看

排行第四:世界编辑:在可执行世界中深度干预
将世界编辑定义为对现有可执行世界进行干预,同时保留应保持不变的性质,引入干预深度描述编辑耦合世界实体、动态和系统的强度。通过行业级游戏模组实例化该能力,提出IGMWorld和IGMBench基准,包含110个任务和超过1.1K可执行状态及行为标准,涵盖Minecraft和Terraria中的属性、实体、动态和系统任务。(论文赞 1)
在 Hugging Face 查看

排行第五:iADD:改进扩散策略优化的对齐与多样性
研究基于强化学习的扩散模型后训练,如去噪扩散策略优化(DDPO),在奖励函数下优化反向扩散过程。分析理论框架,数学证明仅更新后期时间步可能损害多样性,与先前结论相反。提出基于Feynman-Kac理论的增量训练方法,旨在通过谨慎方法设计实现更好的权衡。
在 Hugging Face 查看

排行第六:FairRSFM:遥感基础模型的生物群系感知基准与去偏框架
引入FairRSFM,一个生物群系感知基准,用于评估遥感基础模型(RSFMs)的生态组鲁棒性。它将14个陆地生物群系样本映射到6个生态宏观组,在统一冻结骨干评估协议下评估模型。基准覆盖四个下游数据集,使用Prithvi-EO-2.0等模型显示聚合性能一致,但隐藏跨生态区域的系统差异。(论文赞 1)
在 Hugging Face 查看

排行第七:Video2Skill:从流式体验到可复用的具身技能
操纵行为因物体和场景不同而多样,但共享少量可复用技能。现有智能体仅能使用已知技能,需从经验中恢复技能。本文提出流式具身技能发现(SESD)问题:模型按顺序观看视频,维护持久技能库以辅助后续决策,探索视觉语言模型(VLMs)能否将事件流组织为可复用技能。(论文赞 7)
在 Hugging Face 查看

排行第八:ProgressCompass:无恰当上下文时具身进度奖励模型会失效
智能体执行长任务时,仅看最终成败不足以评估进展,需分步判断。进度奖励模型(PRMs)可实时评分任务进展,但当前帧常无法反映进度(依赖历史),即上下文依赖的进度估计问题。现有基准多关注短任务,PRMs在需上下文场景下的表现尚未充分探索。(论文赞 6)
在 Hugging Face 查看

排行第九:Foresight:流式VLMs无需再训练即可规划未来感知
现有流式视觉语言模型(VLMs)推理时计算路径固定,无法适应场景动态变化。本文发现其具备预测近期未来的能力,从而无需再训练即可动态配置未来计算。关键挑战是未来预测需足够可靠以引导计算,且规划需与流式处理并发。
在 Hugging Face 查看

排行第十:DeskForge:为计算机使用代理提供桌面环境密集监督
计算机使用代理需在复杂桌面场景(多应用、重叠窗口)中定位操作目标,但现有训练数据缺乏密集标注。DeskForge是可控桌面环境,可组合真实应用、变化状态/布局/外观,融合截图、辅助树和窗口几何生成密集元素标注,并记录操作结果,用于大规模监督。(论文赞 5)
在 Hugging Face 查看

排行第十一:MM-ABC:通过感知、协调和想象实现通用移动操纵
移动操纵通过可控可达区域扩展机器人工作空间,面临连续自运动下的空间感知和机械臂/底座协调控制挑战。现有方法常依赖3D表示或世界模型,分离移动与操纵。MM-ABC是基础模型,通过感知、协调和想象支持跨流协作,实现通用移动操纵。(论文赞 1)
在 Hugging Face 查看

排行第十二:LMBuild:评估大语言模型代理生成可建造功能性结构的能力
大语言模型(LLM)代理能生成复杂3D结构,但现有评估多关注几何质量,忽略物理可实现性(可建造、功能性)。LMBuild是评估基准,要求生成含零件分解、连接、材料和序列的结构,支持可复现评估。(论文赞 20)
在 Hugging Face 查看



扫描二维码,在手机上阅读

热榜(2026年10月07日 01:45 北京时间)

AK:乔治·格格拉诺夫:llama.cpp 中 Embedding…

评 论
评论已关闭