Hugging Face 模型趋势榜和每日论文。
模型
排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4908,趋势分 1140。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4908 · 趋势分 1140)
在 Hugging Face 查看
排行第二:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1245,趋势分 888。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 1245 · 趋势分 888)
在 Hugging Face 查看
排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2755,趋势分 759。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2755 · 趋势分 759)
在 Hugging Face 查看
排行第四:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 553,趋势分 549。标签:qwen3_5、clef、cloudflare、systemone、qwen3.8。(点赞 553 · 趋势分 549)
在 Hugging Face 查看
排行第五:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2812,趋势分 411。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2812 · 趋势分 411)
在 Hugging Face 查看
排行第六:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 633,趋势分 408。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 633 · 趋势分 408)
在 Hugging Face 查看
排行第七:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5902,趋势分 372。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5902 · 趋势分 372)
在 Hugging Face 查看
排行第八:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16753,趋势分 349。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16753 · 趋势分 349)
在 Hugging Face 查看
排行第九:Julia-1(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 350,趋势分 336。标签:decision-model、multilingual、routing、base_model:jhu-clsp/mmBERT-small、base_model:finetune:jhu-clsp/mmBERT-small。(点赞 350 · 趋势分 336)
在 Hugging Face 查看
排行第十:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 515,趋势分 286。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 515 · 趋势分 286)
在 Hugging Face 查看
排行第十一:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 613,趋势分 271。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 613 · 趋势分 271)
在 Hugging Face 查看
排行第十二:VisionHOPE(图像分类)
Hugging Face 趋势榜上的模型,任务类型是图像分类,点赞 363,趋势分 255。标签:computer-vision、visionhope。(点赞 363 · 趋势分 255)
在 Hugging Face 查看
论文
排行第一:JevSpawn:通过组合动作空间实现自适应代理推理
本文提出JevSpawn模型,通过组合策略将自然语言任务描述与有限概率探索连接起来。该方法结合并行动作生成与反馈驱动的分支选择、表示修订和替代方案恢复机制,提升代理推理效率和自主性。(论文赞 1)
在 Hugging Face 查看
排行第二:Architect-Ant:可编辑的建筑平面自动家具布置
本文提出Architect-Ant框架,利用预训练模型从真实建筑平面中学习专业家具布置知识,实现约束感知的布局生成。通过AntPlan数据集支持高效自动家具布置,减少对昂贵迭代推理的依赖。(论文赞 4)
在 Hugging Face 查看
排行第三:修正何时变为修复:工具使用LLM内部干预机制审计
本文提出SAKIKO审计框架,用于分析工具使用LLM中内部激活干预的机制。通过方向性错误发现、路由条件干预、目标解析验证等方法,揭示干预对模型决策的影响,提升对模型内部状态变化的诊断能力。(论文赞 1)
在 Hugging Face 查看
排行第四:LOCI:流式世界模型的空间线性记忆
本文提出LOCI空间记忆架构,结合关键值缓存与循环记忆,实现对视频世界模型中重复观察区域的高效记忆和检索。该方法在保持视觉细节的同时,支持当前视角下的历史观察访问。(论文赞 3)
在 Hugging Face 查看
排行第五:PhysVista:基于感知-推理-评估循环的物理智能基准测试
本文提出PhysVista基准测试,通过感知-推理-评估闭环框架评估视觉语言模型的物理智能。该方法克服现有基准碎片化问题,全面评估模型对物理一致性的理解和判断能力。(论文赞 7)
在 Hugging Face 查看
排行第六:Latent-Foresight:端到端学习可预测的潜在世界模型表示
本文提出Latent-Foresight方法,通过端到端学习可预测的潜在表示来构建世界模型。该方法避免传统两阶段管道的解耦问题,直接在视觉基础模型特征空间中进行预测,提升未来场景理解性能。
在 Hugging Face 查看
排行第七:泛化是稳定性,不是准确性:大语言模型的多维度评估
论文探讨了大语言模型(LLMs)在不同输入表达方式下生成一致且语义稳定的输出能力,即泛化能力。现有研究通常通过单一提示格式、任务或变化集的总体准确性来评估泛化,这将鲁棒性与整体基准表现混淆。本文从单个示例、多个输入变体和模型行为的不同方面进行评估,关注输出的变异性,而非通过狭窄训练或其他方式将性能简化为分数。(论文赞 4)
在 Hugging Face 查看
排行第八:去除麦垛中的针:通过权重正交化去除大语言模型中的后门
后门攻击可能在大语言模型(LLMs)训练期间植入,导致输入中出现触发器时产生不良行为。现有后门防御方法试图移除后门,但可能无意中改变模型输出分布,导致模型性能和安全性下降。本文提出NEEDLE,一种无需训练的针对性后门移除方法。一旦识别出触发器,该方法通过激活向量估计后门方向和拒绝子空间,然后应用顺序权重正交化以抑制后门,同时防止与拒绝相关的表示发生变化。(论文赞 3)
在 Hugging Face 查看
排行第九:在它消逝之前:在视频大语言模型推理时强化时间表示
视频大语言模型(VideoLLMs)按顺序接收帧并解释视觉内容如何随时间演变,但时间推理能力仍是各种架构的持续弱点。反转视频帧顺序应使时间答案反转,但最终预测通常不变。本文通过定义时间发散向量τ_l,即由反转时间顺序引起的逐层表示差异,来研究这种失败的来源。跟踪其在各层的幅度,揭示了一个一致的时间发散分布,其中发散在中间层达到峰值,随后逐渐减小。
在 Hugging Face 查看
排行第十:CorrGRPO:用于多奖励学习的归一化GRPO方法
组相对策略优化(GRPO)广泛用于训练推理语言模型,它通过在相同提示的多个推理中对奖励进行中心化和归一化来计算优势。对于多个奖励,GRPO将奖励组件相加,并通过组内标准差归一化总奖励。相应的方差等于所有奖励对之间的协方差之和。对于固定中心化奖励,较大的总协方差会产生较小的优势,反之亦然,从而使更新幅度适应奖励之间的依赖关系。然而,大规模的相关奖励可能会主导这种归一化,抑制小规模奖励的信号。我们提出CorrGRPO方法。(论文赞 10)
在 Hugging Face 查看
排行第十一:更少的token,更好的动作:GPT-6 Astra机器人代理
视觉语言模型(VLM)代理可以通过视觉反馈和动作原语控制机器人,但重复调用模型和冗余观察会导致大量token开销。本文引入PyRUA-Lean,一种交互式代码执行框架,将反馈驱动的动作组合与选择性观察相结合:代理将经典机器人原语和学习到的视觉语言动作(VLA)策略组合成Python单元,执行条件检查和局部重试,仅返回明确请求的图像和状态反馈以重新规划。在LIBERO-PRO、RoboTwin 2.0和RoboCasa365的700个模拟任务实例中,我们比较了PyRUA-Lea(论文赞 9)
在 Hugging Face 查看
排行第十二:OneStreamer:统一流媒体视频交互中的感知、记忆和主动响应
流媒体视频大语言模型(LLMs)必须在尚未知其对未来任务的相关性时保留证据,并在证据充足时做出响应。挑战在于形成可重用的事实记忆而不影响实时感知。本文提出OneStreamer,它通过共享的主动生成过程联合学习查询无关的证据记录和任务响应。其主动分层字幕记忆(PHCM)生成时间锚定的局部细节字幕和已完成事件的摘要。流媒体字幕目标在训练过程中监督对观察到的视频前缀的解释。在推理过程中,模型生成的记录补充最近的视觉窗口,提供可重用的信息。(论文赞 62)
在 Hugging Face 查看
