HF榜单(2026年10月06日 12:45 北京时间)


clef(图文理解)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1529,趋势分 1411。标签:qwen3_5、clef、cloudflare、systemone、qwen3.8。(点赞 1529 · 趋势分 1411)
在 Hugging Face 查看

排行第二:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 3280,趋势分 677。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 3280 · 趋势分 677)
在 Hugging Face 查看

排行第三:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 5247,趋势分 654。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 5247 · 趋势分 654)
在 Hugging Face 查看

排行第四:Kolibri-1(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 641,趋势分 618。标签:vllm、kolibri1、reasoning、moe、conversational。(点赞 641 · 趋势分 618)
在 Hugging Face 查看

排行第五:JEV-27B-VL(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 708,趋势分 569。标签:qwen3_5、jev、system-one、system-two、typed-decisions。(点赞 708 · 趋势分 569)
在 Hugging Face 查看

排行第六:clef-flash(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 538,趋势分 514。标签:qwen3_5、clef、cloudflare、systemone、qwen3.5。(点赞 538 · 趋势分 514)
在 Hugging Face 查看

排行第七:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 6517,趋势分 497。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 6517 · 趋势分 497)
在 Hugging Face 查看

排行第八:Xing4.0-29B-A4B-GGUF(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 419,趋势分 398。标签:xing4_0、conversational、custom_code、base_model:XingChen-AGI/Xing4.0-29B-A4B、base_model:quantized:XingChen-AGI/Xing4.0-29B-A4B。(点赞 419 · 趋势分 398)
在 Hugging Face 查看

排行第九:GEV-26B-Decide(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 471,趋势分 360。标签:gemma4、image-text-to-text、system-one、system-two、adaptive-thinking。(点赞 471 · 趋势分 360)
在 Hugging Face 查看

排行第十:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 17047,趋势分 349。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 17047 · 趋势分 349)
在 Hugging Face 查看

排行第十一:VisionHOPE(图像分类)
Hugging Face 趋势榜上的模型,任务类型是图像分类,点赞 426,趋势分 305。标签:computer-vision、visionhope。(点赞 426 · 趋势分 305)
在 Hugging Face 查看

排行第十二:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 3006,趋势分 280。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 3006 · 趋势分 280)
在 Hugging Face 查看

论文

排行第一:动态助手法搜索:通过预测构建多代理系统
助手法指定了解决任务的角色、指令、工具和交流结构,正确助手法取决于查询。由于每个设计选择的价值只有在执行后才能观察到,因此为每个查询定制助手法需要要么在推理时间执行备选方案,要么进行昂贵的手动设计。我们介绍了SHIFT,它将执行移出每查询搜索循环。局部LLM架构师从搜索中学习构建助手法的策略,以及从测量执行中预测准确性与执行成本之间平衡的价值函数。对于每个查询,蒙特卡洛树搜索使用这些预测来构建助手法。(论文赞 1)
在 Hugging Face 查看

排行第二:RealtimeWAM:一步异步世界行动模型
世界行动模型(WAM)将视频生成主干模型的视觉表示纳入行动预测。最近的高效WAM采用混合变换器(MoT)架构,并计算视频表示一次以供动作专家重复使用。然而,专家内部迭代(即,多步骤动作去噪)和专家之间的等待(即,视频和动作专家的顺序执行)仍然限制了推理效率。为此,我们提出了RealtimeWAM,这是一种具有一步动作生成和异步推理的极其高效的WAM变体,解决了这两个瓶颈。为了减少专家内部迭代,我们提出了教师锚定一致性蒸馏...(论文赞 3)
在 Hugging Face 查看

排行第三:何时切换:视觉-语言-动作模型的可靠动作块扩展
视觉-语言-动作(VLA)模型作为统一策略用于机器人操作,但其昂贵的推理迫使机器人在策略调用之间暂停,导致中断平滑运动并延长任务完成时间。扩展动作块可以减少策略调用次数,从而减少这些暂停,但预测更远会使长块执行变得不可靠。为了理解这种不可靠性的来源,我们分析了长块内的动作错误,发现它们集中在子技能之间的转换点,随着块长度增长而尖锐增长。这表明切换子技能时机的重要性,即何时切换子技能,我们通过实验验证了这一假设...(论文赞 2)
在 Hugging Face 查看

排行第四:基础模型可通过训练数据提示进行推理
在本研究中,我们探讨了训练数据如何创建基础模型响应开头令牌与后续推理行为之间的关联。首先,我们证明固定特定起始令牌可以使基础模型在数学和编程任务上的表现与强化学习(RL)训练的对抗模型相当。例如,令牌".\n\nOkay"将Olmo-3-7B模型的MATH-500通过率从42%提高到78%,而"Alright,"将Qwen3-14B模型的通过率从72%提高到87%。其次,RL使这些令牌更有可能出现,而固定它们可以恢复其相对于基础模型的大部分性能 gain。第三,我们追踪令牌提(论文赞 2)
在 Hugging Face 查看

排行第五:ALoDLM:自适应循环扩散语言模型
扩散语言模型(DLMs)通过并行预测多个令牌实现快速生成,但其实际应用仍受质量差距的限制,与同等大小的自回归(AR)模型相比。我们将这一差距归因于计算难度不匹配:在部分观察的序列中,有些未知令牌容易预测,而有些则需要更多计算。现有DLMs对所有未知位置应用统一的计算深度。我们介绍了ALoDLM,它用令牌感知的潜伏循环替换了统一计算。在每个去噪步骤中,ALoDLM迭代精炼潜伏表示...(论文赞 27)
在 Hugging Face 查看

排行第六:正确完成循环模型的第二部分:在固定点重新思考
每次循环都会增加训练、解码、预填充和强化学习(RL)的成本。循环状态越接近固定点,路径的重要性越小。这使得训练中可以截断反向传播;终端键值(KV)共享几乎无需损失准确性;蒸馏学生可以在1.79倍的时间内预填充;RL更新可以从保存的滚动状态计算梯度,比回传重新播放轨迹的速度快2倍。因此,我们改进了塑造这些固定点的两个训练组件:深度先验和输入注入。固定深度训练会破坏KV共享,Huginn的广泛深度...(论文赞 3)
在 Hugging Face 查看

排行第七:Kandinsky 6.0 Video:同步音视频生成基础模型
本文介绍了Kandinsky 6.0 Video,一个用于同步文本到音视频生成的基础扩散模型系列,包括轻量版(3B参数)和专业版(29B参数)。模型能够根据文本或图像输入生成5秒的视频片段,并同步产生44 kHz音频,支持口型同步。内置超分辨率模块可将输出提升至全高清画质。该模型基于Kandinsky 5.0的视频生成能力,采用双流CrossDiT架构,通过双向连接将预训练视频流与新训练的音频流整合。(论文赞 9)
在 Hugging Face 查看

排行第八:InterMimicGen:通过自进化模仿扩展人形机器人操作
本文提出InterMimicGen,一个自进化运动模仿框架,旨在利用人类-物体交互数据提升人形机器人的全身协调操作能力。方法首先整合运动捕捉数据,将其重定向为机器人可执行的参考动作,保持全身协调和手部灵巧操作关系。然后训练一个基于物理的通用跟踪策略来执行这些参考动作。框架通过机器人运动数据与跟踪策略的相互改进,实现自我演化,解决数据稀疏和异构问题。
在 Hugging Face 查看

排行第九:CANOPY:多模态RAG的自适应粒度证据压缩
本文介绍CANOPY框架,用于多模态检索增强生成中的自适应粒度证据压缩。方法解决检索单元粒度选择问题:粗粒度包含无关内容,而均匀细粒度可能丢失解释证据所需的上下文。CANOPY将检索项表示为层次结构,通过微调的节点编码器对每个区域动态调整保留程度,实现跨文本、表格、图像和视频等异构项目的共享压缩程序,优化证据相关性。(论文赞 9)
在 Hugging Face 查看

排行第十:ASCENT:基于自蒸馏的在线测试时训练
本文研究在线代理测试时训练方法,用于提升大语言模型代理在长周期任务中的性能。代理通过多轮推理-行动执行任务,仅在任务结束时获得验证信号。方法在部署过程中利用代理自身执行轨迹对模型权重进行训练,每个任务仅执行一次,轨迹及验证结果作为唯一学习信号。相比基于文本记忆的适应方法,该方法直接优化模型参数,实现持续改进。(论文赞 10)
在 Hugging Face 查看

排行第十一:PaLoRA:持续学习的步进低秩适应
本文分析LoRA类持续学习方法中学习率启发式限制的不足。指出即使采用方向约束如零空间投影,有限精度更新仍会沿多个方向泄漏到历史知识子空间。小学习率虽可减弱泄漏,但无法阻止随着历史知识有效秩增长而加剧的遗忘累积。研究揭示了固定启发式缺乏理论指导的问题,为优化持续学习策略提供新视角。(论文赞 2)
在 Hugging Face 查看

排行第十二:PluginRSI:利用可复用插件改进代理框架
本文提出PluginRSI方法,通过原子化插件组合表示语言模型代理的框架。方法将框架优化组织为插件的独立改进和积累,个体插件在共享库中演化并被重新组合成新框架。相比搜索完整程序的方法,PluginRSI支持机制隔离和复用,在软件工程、命令行交互和问答任务中表现更优,且优势具有持续性。(论文赞 2)
在 Hugging Face 查看



扫描二维码,在手机上阅读

中文科技热榜(2026年10月06日 12:45 北京时间)

HN榜单(2026年10月06日 12:45 北京时间)

评 论
评论已关闭