HF榜单(2026年10月02日 08:15 北京时间)


laya(文本分类)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4863,趋势分 1226。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4863 · 趋势分 1226)
在 Hugging Face 查看

排行第二:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1222,趋势分 882。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 1222 · 趋势分 882)
在 Hugging Face 查看

排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2704,趋势分 784。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2704 · 趋势分 784)
在 Hugging Face 查看

排行第四:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2786,趋势分 444。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2786 · 趋势分 444)
在 Hugging Face 查看

排行第五:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 623,趋势分 442。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 623 · 趋势分 442)
在 Hugging Face 查看

排行第六:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5856,趋势分 369。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5856 · 趋势分 369)
在 Hugging Face 查看

排行第七:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16726,趋势分 350。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16726 · 趋势分 350)
在 Hugging Face 查看

排行第八:Julia-1(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 339,趋势分 325。标签:decision-model、multilingual、routing、base_model:jhu-clsp/mmBERT-small、base_model:finetune:jhu-clsp/mmBERT-small。(点赞 339 · 趋势分 325)
在 Hugging Face 查看

排行第九:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 303,趋势分 300。标签:qwen3_5、clef、cloudflare、systemone、qwen3.8。(点赞 303 · 趋势分 300)
在 Hugging Face 查看

排行第十:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 599,趋势分 296。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 599 · 趋势分 296)
在 Hugging Face 查看

排行第十一:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 496,趋势分 290。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 496 · 趋势分 290)
在 Hugging Face 查看

排行第十二:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2332,趋势分 261。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2332 · 趋势分 261)
在 Hugging Face 查看

论文

排行第一:PixelUMM:无编码器的统一图像与视频理解生成
本文提出PixelUMM,一种直接在像素空间工作的无编码器模型,统一处理图像和视频的理解与生成任务。传统统一多模态模型依赖分离的视觉表示,增加了上下文长度并难以整合现有视觉语言预训练流程。PixelUMM将图像表示为空间块,视频表示为时空块,解决了视频理解与生成采用不同时间表示的挑战,旨在简化模型设计并提升效率。(论文赞 4)
在 Hugging Face 查看

排行第二:基于语言反馈的LLM评判器位置自蒸馏训练
本研究探讨如何利用自然语言反馈训练大型语言模型(LLM)作为评判器,特别针对主观性任务,其中判决结果强烈依赖于评判器选择的标准及其权重。传统结果监督强化学习方法仅根据最终判决准确性分配标量奖励,忽略了标准选择令牌和丰富的语言反馈。自蒸馏方法通过同一模型在反馈条件下作为教师,提供密集的位置选择性监督,以更有效地利用语言反馈改进评判能力。(论文赞 5)
在 Hugging Face 查看

排行第三:奖励加权传输蒸馏对齐一步生成模型
本文介绍奖励加权传输蒸馏(RWTD),一种用于一步生成模型的训练后对齐方法。一步生成器通过单次网络评估实现高质量视觉生成,但训练后调整困难,因为隐式生成器缺乏易处理似然或去噪轨迹,且许多奖励不可微。RWTD仅需生成样本和标量奖励评估,构建自适应目标混合当前和参考分布,结合训练中发现改进,促进模型与奖励函数更好对齐。(论文赞 2)
在 Hugging Face 查看

排行第四:Tacit-TTS:从自回归解码到掩码预测的高效免转录语音克隆
Tacit-TTS是一种高效的免转录零样本语音克隆系统,基于IndexTTS2蒸馏而来。自回归语义建模的TTS系统虽具强克隆性能和丰富表达变化,但顺序解码导致高延迟。非自回归替代方案生成更快,但常需推理时参考语音的转录文本。本模型用掩码非自回归生成替换自回归文本到语义解码,引入无训练声学长度估计,并加速流匹配渲染器,实现快速免转录克隆。(论文赞 8)
在 Hugging Face 查看

排行第五:BiasReducer:奖励模型的自适应偏差缓解框架
BiasReducer是一个轻量级框架,用于缓解奖励模型的偏差问题。奖励模型评分LLM响应并引导其训练符合人类偏好,但可能偏向长度或置信度等表面属性,导致LLM产生高分但不更正确的响应。现有方法需重新训练奖励模型或对已知偏差应用固定校正。BiasReducer仅编辑线性奖励头,动态检测和减轻多种偏差,无需重新训练或预先指定偏差类型,资源需求低。(论文赞 18)
在 Hugging Face 查看

排行第六:BIABench:在真实生物图像分析任务评估AI智能体
BIABench是一个基准测试,包含16个从已发表生物学研究重建的任务,用于评估AI智能体在真实世界生物图像分析中的端到端能力。这些任务涉及2D图像、3D体积和延时序列,数据量大难以直接作为上下文,要求智能体通过代码、专业软件和渲染视图选择并执行分析。基准保留科学问题、成像数据和真实结果,涵盖十一种分析类型,测试智能体自动化生物图像分析的实用性。(论文赞 4)
在 Hugging Face 查看

排行第七:DAGent:深度研究代理的“先评估后扩展”规划方法
深度研究任务需代理导航知识空间、跨源合成证据并随发现调整计划。现有基于DAG的代理采用“先规划后修补”策略,因在证据薄弱时就确定计划,易浪费计算。本文提出DAGent,采用“先评估后扩展”规划解决该问题(论文赞 3)
在 Hugging Face 查看

排行第八:MILO:通过协同多代理进化实现自动化harness发现
现代代理系统需模型与控制执行的harness结合,harness设计影响长期性能但搜索空间大。现有自动化方法仅优化部分组件或策略固定。MILO引入协同进化框架,共进化harness和发现策略,结合层级谱系记忆与岛式树结构解决问题(论文赞 15)
在 Hugging Face 查看

排行第九:提示身份会降低多代理LLM系统的合作效果
多代理LLM系统混合多模型时,暴露代理底层模型身份会严重损害合作——代理会因模型标签分裂为集群,偏好同标签交互,任务无此要求。研究在合作游戏和推理基准中验证,隐藏身份可缓解该问题(论文赞 3)
在 Hugging Face 查看

排行第十:基于项目反应理论的量规式奖励设计
多数语言任务无自动答案,需用量规(评估标准)判断,强化学习中需将量规结果转为标量奖励。常见求和方法易混淆不同结果,且固定分数未体现区分度。本文提出Rubric Response Theory(RRT)测量质量并选择标准,解决聚合和高判断成本问题(论文赞 10)
在 Hugging Face 查看

排行第十一:跨会议的持久说话人归因评估:谁说了什么及是否被记住
语音转录作为长期记忆需保留内容和稳定说话人身份,现有指标无法衡量跨会议同一人身份一致性。本文提出SI-cpWER指标(全局说话人ID下评分),评估5个商业系统、2个开源基线及自研ThyVoice在CHiME-8等数据集的效果(论文赞 2)
在 Hugging Face 查看

排行第十二:MemLife:长期第一人称视频记忆的整理与推理
长期第一人称视频助个性化AI推理生活,但数百小时视频重新处理耗时。记忆系统虽压缩为文本,却存在证据丢失或检索竞争问题。MemLife引入多模态记忆系统,构建实体相关的第一人称文本片段,通过时间感知检索器解决检索问题(论文赞 2)
在 Hugging Face 查看



扫描二维码,在手机上阅读

Trump Truth:我之前多次说过,要消除伊朗的核威胁只需要4到6周的时间,而我…

HN榜单(2026年10月02日 08:15 北京时间)

评 论
评论已关闭