HF榜单(2026年09月30日 08:15 北京时间)


laya(文本分类)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4506,趋势分 1793。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4506 · 趋势分 1793)
在 Hugging Face 查看

排行第二:Audio8-ASR-Infinite(语音识别)
Hugging Face 趋势榜上的模型,任务类型是语音识别,点赞 1512,趋势分 1327。标签:audio8_asr_infinite、text-generation、streaming、realtime、speech-recognition。(点赞 1512 · 趋势分 1327)
在 Hugging Face 查看

排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2435,趋势分 1079。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2435 · 趋势分 1079)
在 Hugging Face 查看

排行第四:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 867,趋势分 732。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 867 · 趋势分 732)
在 Hugging Face 查看

排行第五:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2656,趋势分 714。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2656 · 趋势分 714)
在 Hugging Face 查看

排行第六:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 527,趋势分 518。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 527 · 趋势分 518)
在 Hugging Face 查看

排行第七:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 517,趋势分 498。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 517 · 趋势分 498)
在 Hugging Face 查看

排行第八:Xing4.0-29B-A4B(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 1808,趋势分 412。标签:xing4_0、conversational、custom_code。(点赞 1808 · 趋势分 412)
在 Hugging Face 查看

排行第九:ZDTaichu5.0-9B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1947,趋势分 396。标签:zdtaichu5_0、multimodal、vision-language-model、spatial-reasoning、agent。(点赞 1947 · 趋势分 396)
在 Hugging Face 查看

排行第十:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 425,趋势分 388。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 425 · 趋势分 388)
在 Hugging Face 查看

排行第十一:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2267,趋势分 353。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2267 · 趋势分 353)
在 Hugging Face 查看

排行第十二:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16565,趋势分 352。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16565 · 趋势分 352)
在 Hugging Face 查看

论文

排行第一:生成前的规范:在金融、时间、幂等性和访问任务中对LLM生成代码的五模型配对评估
大型语言模型生成的代码通过安全检查的比率在过去四年中几乎没有变化。在受监管的后端系统中,最重要的缺陷类别是货币计算、时间处理、重试安全性和访问控制。本文测试了一个更具体的概念:当提示包含规范(即固定前言,声明结果必须满足的条件)时,生成的代码会得到改进。研究预注册了假设、反驳者、分析代码和一次性生成规则,然后通过五个模型对50个来自金融、医疗和保险实践的真实后端任务进行了评估。
在 Hugging Face 查看

排行第二:NVAlign:连续自回归流匹配文本到语音中的非言语控制直接梯度优化
尽管现代文本到语音(TTS)系统能够生成高度自然的语音并支持内联非言语发声(NVV)标签,但对这些事件的精确控制仍然具有挑战性。本文提出NVAlign,一种直接梯度后训练框架,用于TTS架构中的NVV标签跟随。首先对TTS模型和NVV感知的自动语音识别(NV-ASR)模型进行监督微调,然后冻结NV-ASR模型作为后训练的奖励模型。通过两步梯度代理,NVAlign能够高效地优化NVV标签的生成。(论文赞 3)
在 Hugging Face 查看

排行第三:在策略蒸馏大型语言模型时真的需要KL散度吗?
自知识蒸馏出现以来,KL散度一直是蒸馏的标准损失函数。最近,策略蒸馏(OPD)成为LLM的一种高效后训练范式。作为蒸馏方法,OPD自然继承了KL散度作为标准损失。然而,本文发现KL散度可能不是OPD所必需的。研究显示,只要更新方向朝向教师模型,OPD就能有效工作。具体来说,关键在于一小部分教师和学生模型强烈分歧的标记的更新方向。
在 Hugging Face 查看

排行第四:WhiteMatter:通过KV源混合实现全层交叉连接
在生成文本时,Transformer在每一层都会生成过去标记的表示,但每一层通常只能使用相同深度的表示。这种限制使得模型无法充分利用已计算的信息。本文引入了WhiteMatter,允许每一层从任何深度的过去标记表示中获取信息。通过学习的混合器选择当前上下文中最有用的深度,并将它们的表示组合到共享的键值(KV)缓存通道中。这可以减少缓存大小,且在相同数量的训练标记下,WhiteMatter与标准Transformer的性能相当。(论文赞 2)
在 Hugging Face 查看

排行第五:我们能信任教师吗?自我蒸馏中的分离信用方向和幅度
RLVR提供可靠的轨迹级信用,而OPSD提供密集的标记级信用监督。这暴露了在使用教师监督更新步骤级信用方向和幅度时的基本耦合问题,导致步骤无法获得可靠的信用方向和贡献幅度,同时使两者都容易受到教师判断错误和偏好变化的影响。本文引入了分离信用自我蒸馏(DCSD),理论上将信用方向和幅度分离为两个可靠的信号,并用它们来校准教师监督。(论文赞 3)
在 Hugging Face 查看

排行第六:ExpVoyager:动态代理技能合成的直接经验导航
从经验中学习已成为开发自进化代理的关键范式,这些代理能够持续学习和扩展能力。在此范式中,代理技能的合成是一种有前景的解决方案,可以将积累的经验转化为可重用的过程知识,作为运行时提供代理的支持系统的重要层。尽管有潜力,但现有方法大多在下游需求未知的情况下将过去的经验抽象为固定的过程知识,这可能导致丢弃后来变得关键的知识,同时保留与未来任务无关的实例特定细节。本文提出了一种新的方法ExpVoyager,通过直接经验导航来动态合成代理技能。(论文赞 8)
在 Hugging Face 查看

排行第七:Allspark:通过交替思维链的弱到强迁移
该研究探讨了如何让小型弱模型的推理改进帮助大型强模型,而无需在训练中使用强模型的推演。提出Allspark框架,通过交替思维链实现弱到强迁移,弱教师与冻结模型交替推理,最终由冻结模型输出答案。(论文赞 2)
在 Hugging Face 查看

排行第八:SentZero:用于多任务零样本胸部X光分析的增强句级视觉语言预训练
针对胸部X光图像与放射学报告的视觉语言预训练方法,提出SentZero框架,通过临床短语增强句级预训练,克服报告冗长和对齐困难的问题,提升多任务零样本分析性能。(论文赞 25)
在 Hugging Face 查看

排行第九:谁获得token,它承载什么?大模型中姓名支持与概念访问的不平等
研究发现大语言模型中姓名的token化存在不平等现象,部分姓名可直接映射为单个token,而其他姓名则需拆分为多个子词,造成姓名表面支持的不均等,影响模型对不同人群的处理方式。(论文赞 2)
在 Hugging Face 查看

排行第十:VisionHOPE:视觉主干作为自我修改的学习系统
提出VisionHOPE框架,将视觉主干建模为自我修改的学习系统,模型记忆与学习过程在图像处理中共同演化,突破传统视觉模型的固定结构限制,提升适应性。(论文赞 107)
在 Hugging Face 查看

排行第十一:用夜间科学强化代理创造力在科学构想中的应用
针对大语言模型在科学构想中缺乏创造性的问题,提出AI夜间科学家框架,结合强化学习引导模型跳出常规推理路径,模拟从日间科学到夜间科学的创造性思维过程。(论文赞 2)
在 Hugging Face 查看

排行第十二:几何即地址:用于长时序摄像控制视频生成的视觉记忆路由
提出GEAR框架,利用几何信息作为视觉记忆的显式地址,实现高效长时序视频生成,避免传统方法中记忆访问效率低或几何误差累积的问题,提升视觉内容恢复能力。(论文赞 2)
在 Hugging Face 查看



扫描二维码,在手机上阅读

Trump Truth:唐纳德·J·特朗普的新媒体帖子(发布时间:2026年9月29…

HN榜单(2026年09月30日 08:15 北京时间)

评 论
评论已关闭