HF榜单(2026年10月02日 02:15 北京时间)


laya(文本分类)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4794,趋势分 1245。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4794 · 趋势分 1245)
在 Hugging Face 查看

排行第二:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1187,趋势分 870。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 1187 · 趋势分 870)
在 Hugging Face 查看

排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2670,趋势分 799。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2670 · 趋势分 799)
在 Hugging Face 查看

排行第四:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 608,趋势分 468。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 608 · 趋势分 468)
在 Hugging Face 查看

排行第五:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2757,趋势分 460。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2757 · 趋势分 460)
在 Hugging Face 查看

排行第六:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5820,趋势分 370。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5820 · 趋势分 370)
在 Hugging Face 查看

排行第七:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16706,趋势分 354。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16706 · 趋势分 354)
在 Hugging Face 查看

排行第八:Julia-1(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 333,趋势分 321。标签:decision-model、multilingual、routing、base_model:jhu-clsp/mmBERT-small、base_model:finetune:jhu-clsp/mmBERT-small。(点赞 333 · 趋势分 321)
在 Hugging Face 查看

排行第九:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 590,趋势分 306。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 590 · 趋势分 306)
在 Hugging Face 查看

排行第十:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 483,趋势分 288。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 483 · 趋势分 288)
在 Hugging Face 查看

排行第十一:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2328,趋势分 285。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2328 · 趋势分 285)
在 Hugging Face 查看

排行第十二:GLiNER2.5-Decide(序列标注)
Hugging Face 趋势榜上的模型,任务类型是序列标注,点赞 266,趋势分 259。标签:gliner2、extractor、Text classification、Intent classification、Sentiment Analysis。(点赞 266 · 趋势分 259)
在 Hugging Face 查看

论文

排行第一:BiasReducer: 自适应减轻奖励模型偏差
奖励模型对大型语言模型(LLMs)的响应进行评分,并引导LLM训练向人类偏好方向发展。然而,奖励模型可能会倾向于表面属性,如长度或置信度,导致LLMs产生更高分但并不更正确的响应。现有缓解方法要么重新训练奖励模型,要么对已知偏差应用固定校正,如偏好更长响应的偏差。重新训练需要额外的数据和计算资源,而现有编辑方法需要目标偏差在事前指定并使用固定编辑。我们提出了BiasReducer,一个轻量级框架,仅编辑线性奖励函数。(论文赞 2)
在 Hugging Face 查看

排行第二:BIABench: 用于评估AI代理在真实生物图像分析任务中的表现
人工智能(AI)代理在自动化生物图像分析方面具有潜力,但目前没有基准评估它们是否能够端到端地完成真实世界的分析。这些分析对代理来说很难,因为2D图像、3D体积和时间序列往往太大,无法阅读作为上下文,因此代理必须选择和运行分析,通过代码、专业软件和渲染视图。我们引入了BIABench,从16个任务重建的基准测试,这些任务保留了发表过的生物学研究中的原始图像、数据和 ground truth。这些任务涵盖11个分析领域,包括图像分割、细胞检测、3D体积重建等。(论文赞 2)
在 Hugging Face 查看

排行第三:DAGent: 用于深度研究代理的评估-然后-增长规划
深度研究任务要求代理在大知识空间中导航,综合来自许多来源的证据,并在发现新信息时调整其计划。有向无环图(DAG)基于的多代理系统适合这种设置,因为它们支持并行执行,并将每个子任务隔离在专注的依赖关系上下文中。然而,现有基于DAG的代理在执行前实例化任务级计划,并在观察到失败或缺失证据后仅修复图。这种“计划然后修补”的策略对于深度研究是脆弱的:系统在证据最弱时最强烈地承诺,并且后来的修订浪费了本不应规划的分支的计算。我们提出了DAGent,一个评估-然后-增长规划的框架。(论文赞 2)
在 Hugging Face 查看

排行第四:MILO: 通过协调多代理进化进行自动调优发现
现代代理系统结合了AI模型和控制执行及环境交互的 harness。Harness 设计强烈影响长期性能,但其组合搜索空间需要大量人类努力,并且随着模型的变化需要重复。现有的自动方法探索空间狭窄,仅优化提示或技能组件之一,或陷入固定、有剥削性的搜索策略。我们介绍了MILO(元进化岛协调),一个框架, co-evolves 代理harness和发现它们的策略。MILO 结合:(i) 基于岛屿树的层次 lineage 内存,使用拒绝突变作为负面反馈信号;(ii) 进化策略选择下一个(论文赞 5)
在 Hugging Face 查看

排行第五:Prompted Identity Degrades多代理LLM系统中的合作
多代理LLM系统越来越多地混合来自多个提供者的模型,但向代理同伴暴露其底层模型身份显著降低了合作。我们证明,当代理知道彼此模型的家族时,群体会分成集群,其中代理更喜欢与携带相同标签的其他代理互动,尽管任务本身并不奖励或要求这种分割。我们定义这种分割为 factionalism,并展示和测量这种现象在两个合作游戏和一个推理基准上,涉及九个到二十五个代理,来自多达五个开放权重模型家族。我们进一步展示了当宣布的标签与真实标签不同时,BIABench上的两个合作游戏中的现象以及如何测(论文赞 1)
在 Hugging Face 查看

排行第六:Rubric Rewards从项目反应理论
许多语言任务没有单一的答案可以自动检查。 rubrics 提供评判响应的标准。对于强化学习,结果必须组合成一个标量奖励。 一种常见的方法是对满足的标准分配分数。不同的验证模式可能会因此收到相同的奖励,并且固定的点编码每个标准应计数的程度,而不是标准验证的强度如何区分当前轮次。 除了这种聚合问题之外,评判完整 rubric 需要更多的评委请求,随着标准数量的增长。 为解决这些限制,Rubric 响应理论(RRT)测量质量并选择标准何时应被纳入奖励函数。(论文赞 5)
在 Hugging Face 查看

排行第七:跨会议持久说话人归属评估:SI-cpWER方法
本文提出Speaker Identified cpWR(SI-cpWER)指标,用于评估语音转录系统在多个会议中保持说话人身份一致性的能力。现有指标通常忽略说话人或独立重映射匿名说话人,无法衡量同一人在不同会议中是否保持同一身份。研究在CHiME-8 NOTSOFAR和CHiME-6数据集上评估了五种商业级系统、两个学术基线及ThyVoice端到端系统,涵盖干净和噪声增强场景。
在 Hugging Face 查看

排行第八:MemLife:长时第一人称视频记忆管理与推理
MemLife是一种多模态记忆系统,旨在解决长时第一人称视频处理中的可扩展性问题。系统将数百小时的视频压缩为基于实体的文本片段,并通过时序感知检索机制定位相关信息。现有记忆系统常因记忆丢失关键证据或检索竞争而失效,MemLife通过构建实体锚定的第一人称叙事单元,提升对日常生活事件的推理效率。(论文赞 1)
在 Hugging Face 查看

排行第九:SeLMRoute:基于语义证据的LLM路由框架
SeLMRoute框架将大语言模型路由决策分解为三个步骤:提取与候选模型无关的语义证据、学习模型性能、应用部署目标。该方法通过可解释问题(如查询的推理需求分析)生成路由依据,区别于直接依赖查询嵌入或相似示例聚类的传统方法,提升路由决策的透明性和有效性。(论文赞 2)
在 Hugging Face 查看

排行第十:SpatialCORE:LVLM置信感知空间推理框架
SpatialCORE针对大视觉语言模型在空间推理任务中的弱点,提出一种后训练框架。该方法要求模型在生成答案时,必须基于高置信度的物体定位证据(如边界框预测)进行推理。通过强化空间 grounding 与答案正确性的关联,解决现有方法中正确答案可能来自错误推理的问题。
在 Hugging Face 查看

排行第十一:TERRA:地形感知的肌肉骨骼运动重定向控制
TERRA管道从运动学轨迹出发,结合地形先验、接触点估计和自由空间证据,重建任务相关的地形几何。系统进一步考虑解剖学约束和地形适配策略,实现肌肉驱动智能体在复杂地形上的运动重定向与控制,突破现有方法局限于平坦地面的瓶颈。(论文赞 23)
在 Hugging Face 查看

排行第十二:重新思考潜在视觉推理:基于视觉证据的监督
本研究分析多模态大模型的潜在推理机制,发现潜在令牌对图像扰动的响应较弱,存在证据-信用差距。研究指出,仅依赖最终答案奖励的GRPO训练难以有效监督潜在推理过程,提出需要显式监督来确保潜在计算与视觉证据的一致性。(论文赞 83)
在 Hugging Face 查看



扫描二维码,在手机上阅读

Trump Truth:唐纳德·J·特朗普的新媒体帖子(发布时间:2026年10月1…

Trump Truth:我多次说过,消除伊朗核威胁需要4到6周的时间,但我只用了一个…

评 论
评论已关闭