HF榜单(2026年10月06日 09:45 北京时间)


clef(图文理解)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1504,趋势分 1392。标签:qwen3_5、clef、cloudflare、systemone、qwen3.8。(点赞 1504 · 趋势分 1392)
在 Hugging Face 查看

排行第二:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 3268,趋势分 686。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 3268 · 趋势分 686)
在 Hugging Face 查看

排行第三:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 5241,趋势分 683。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 5241 · 趋势分 683)
在 Hugging Face 查看

排行第四:Kolibri-1(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 631,趋势分 610。标签:vllm、kolibri1、reasoning、moe、conversational。(点赞 631 · 趋势分 610)
在 Hugging Face 查看

排行第五:clef-flash(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 535,趋势分 511。标签:qwen3_5、clef、cloudflare、systemone、qwen3.5。(点赞 535 · 趋势分 511)
在 Hugging Face 查看

排行第六:JEV-27B-VL(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 625,趋势分 502。标签:qwen3_5、jev、system-one、system-two、typed-decisions。(点赞 625 · 趋势分 502)
在 Hugging Face 查看

排行第七:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 6502,趋势分 499。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 6502 · 趋势分 499)
在 Hugging Face 查看

排行第八:Xing4.0-29B-A4B-GGUF(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 419,趋势分 398。标签:xing4_0、conversational、custom_code、base_model:XingChen-AGI/Xing4.0-29B-A4B、base_model:quantized:XingChen-AGI/Xing4.0-29B-A4B。(点赞 419 · 趋势分 398)
在 Hugging Face 查看

排行第九:GEV-26B-Decide(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 471,趋势分 360。标签:gemma4、image-text-to-text、system-one、system-two、adaptive-thinking。(点赞 471 · 趋势分 360)
在 Hugging Face 查看

排行第十:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 17039,趋势分 350。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 17039 · 趋势分 350)
在 Hugging Face 查看

排行第十一:VisionHOPE(图像分类)
Hugging Face 趋势榜上的模型,任务类型是图像分类,点赞 426,趋势分 305。标签:computer-vision、visionhope。(点赞 426 · 趋势分 305)
在 Hugging Face 查看

排行第十二:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 3003,趋势分 284。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 3003 · 趋势分 284)
在 Hugging Face 查看

论文

排行第一:PointWAM:面向灵巧机器人操作的3D世界动作建模
PointWAM提出了一种3D世界动作模型,将世界分解为场景和手部,并在共享时空坐标系中联合预测它们的3D点轨迹。该方法旨在通过显式建模3D空间结构和接触几何,改进灵巧操作任务中的动作预测和世界动态预测。(论文赞 14)
在 Hugging Face 查看

排行第二:CUAWright:数字代理的最小统一接口
CUAWright设计了一个约3K行代码的最小终端接口,使用bash命令作为唯一动作接口,文件系统作为可演化空间。它允许数字代理动态创建工具和管理上下文,克服传统GUI接口的静态限制,提升程序化操作灵活性。(论文赞 1)
在 Hugging Face 查看

排行第三:JEPA-TTT:动态变化下规划的持续测试时训练
JEPA-TTT通过自监督方式在测试时持续调整预训练世界模型的潜在动态预测器,以应对训练与测试动态差异。该方法固定视觉编码器和奖励头,利用密集回放形成预测窗口,支持无目标图像或在线奖励的规划。(论文赞 2)
在 Hugging Face 查看

排行第四:WM-VLM:探究内部世界模型的视觉-文本推理
WM-VLM为预训练视觉语言模型添加轻量级世界模型分支,生成中间视觉状态以支持空间推理。通过两阶段训练,模型学习生成下一视觉状态并利用其推理,在可验证中间状态的任务上评估视觉-文本交织推理能力。(论文赞 9)
在 Hugging Face 查看

排行第五:通过聚焦视图改进非结构化知识编辑的事实召回
该研究针对非结构化知识编辑中的上下文依赖问题,探索如何提升大语言模型对编辑段落中单个事实的召回能力。方法旨在修改特定知识的同时保留无关知识和通用能力,避免完整重训练。(论文赞 7)
在 Hugging Face 查看

排行第六:科学领域终端环境的自监督扩展
提出软件在环重建框架,从现有软件工作流中自监督获取参考输出和验证目标。通过执行多输入配置并分区案例,构建终端代理训练环境,减少针对科学等领域任务的重复工程。(论文赞 7)
在 Hugging Face 查看

排行第七:Extender:对数结构化Transformer
提出Extender,一种基于对数结构的Transformer变体。在标准Transformer中,各层通过残差h进行通信。Extender增加了一个拼接通道x,每层不仅输出残差更新δ_ell加到h上,还输出较小的扩展ε_ell附加到x上。前馈网络和q使用h,而注意力的kv投影仅使用x。因此,完整扩展的x包含所有层的kv投影输入,将持久注意力内存从2Ld_model减少到sum|ε_ell|。(论文赞 6)
在 Hugging Face 查看

排行第八:EyeRobot 2.0:无需腕部摄像头的主动凝视
受人类视觉启发,提出一种利用主动凝视实现精细双臂操作的框架,仅使用单个立体摄像头。EyeRobot 2.0通过旋转两个眼点,使视线聚焦于场景中的3D固定点。处理结果通过分配更多视觉令牌到图像中心,集中计算于任务相关特征。这种主动视觉固定(AVF)需要任务执行期间精确协调的凝视,通过分层训练实现:首先训练基于目标物体的低层凝视伺服策略,然后训练目标选择器生成凝视目标。(论文赞 9)
在 Hugging Face 查看

排行第九:4DCodeBench:动态场景逆图形基准
引入4DCodeBench,一个通过代码生成评估4D逆图形的基准,代理从视频中重建动态场景为可执行的图形程序。为此,代理必须将视觉观察转化为场景结构和动态的紧凑表示,通过实现物理模拟等抽象来重现复杂行为。为评估此能力,收集真实世界视频并构建涵盖变形、流体流动和断裂等多样物理现象的合成场景。对前沿模型进行广泛基准测试,发现强大的静态重建能力尚未转化为动态场景的准确重建。(论文赞 19)
在 Hugging Face 查看

排行第十:尾部影响采样用于CVaR策略评估
具有相似平均回报的策略在罕见失败上可能差异显著,但准确估计下尾部条件风险(CVaR)可能需要大量昂贵的回放。当随机工作流的不同条件组件可单独查询时,我们研究如何分配固定评估预算以最准确地估计固定策略的CVaR。我们为每个可查询的条件分布推导出尾部影响,该影响汇总了其不确定性如何影响每个贝尔曼重用中的CVaR。其方差给出了固定设计效率界限和最优内曼分配。尾部影响采样(TIS)从试点模型估计这些影响尺度并重新分配新查询。(论文赞 21)
在 Hugging Face 查看

排行第十一:KeyRec:流式与长视频理解的有限视觉记忆
视觉语言模型越来越多地用于理解长视频和连续流。然而,密集视觉标记随视频时长累积,使长上下文推理成本过高。现有无需训练的视觉标记选择方法通过保留信息性标记降低成本,但可能丢失连贯事件证据,无法区分详细近期观察与长程历史。我们提出KeyRec,一种构建有限视觉记忆的无需训练框架。在查询无关写入期间,KeyRec在视觉缓存中保留细粒度近期观察,并将历史证据组织成结构化事件库。候选事件被提出。(论文赞 8)
在 Hugging Face 查看

排行第十二:检索式开放评估在何处失效?
基于检索的事实性评估,其中LLM生成的主张通过权威医学语料库中的证据进行验证,已成为高风险临床环境中可扩展幻觉检测的主导范式。尽管可靠透明的医学事实验证至关重要,但大多数系统使用F1等聚合指标衡量性能,掩盖了失败发生的位置和原因。现有RAG诊断需要黄金答案或标注的黄金证据,而这在该领域并不存在。我们引入两个全面的分类法,基于对开放性MedExpert数据集和3个封闭性数据集的案例研究,将失败分解为可检索性问题。(论文赞 11)
在 Hugging Face 查看



扫描二维码,在手机上阅读

GitHub榜单(2026年10月06日 09:45 北京时间)

X榜单(2026年10月06日 09:39 北京时间)

评 论
评论已关闭