HF榜单(2026年10月03日 03:45 北京时间)


laya(文本分类)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4965,趋势分 1070。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4965 · 趋势分 1070)
在 Hugging Face 查看

排行第二:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2809,趋势分 755。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2809 · 趋势分 755)
在 Hugging Face 查看

排行第三:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 711,趋势分 700。标签:qwen3_5、clef、cloudflare、systemone、qwen3.8。(点赞 711 · 趋势分 700)
在 Hugging Face 查看

排行第四:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 652,趋势分 402。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 652 · 趋势分 402)
在 Hugging Face 查看

排行第五:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2826,趋势分 386。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2826 · 趋势分 386)
在 Hugging Face 查看

排行第六:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5956,趋势分 383。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5956 · 趋势分 383)
在 Hugging Face 查看

排行第七:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16781,趋势分 355。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16781 · 趋势分 355)
在 Hugging Face 查看

排行第八:Julia-1(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 362,趋势分 347。标签:decision-model、multilingual、routing、base_model:jhu-clsp/mmBERT-small、base_model:finetune:jhu-clsp/mmBERT-small。(点赞 362 · 趋势分 347)
在 Hugging Face 查看

排行第九:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 531,趋势分 281。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 531 · 趋势分 281)
在 Hugging Face 查看

排行第十:VisionHOPE(图像分类)
Hugging Face 趋势榜上的模型,任务类型是图像分类,点赞 367,趋势分 259。标签:computer-vision、visionhope。(点赞 367 · 趋势分 259)
在 Hugging Face 查看

排行第十一:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 621,趋势分 256。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 621 · 趋势分 256)
在 Hugging Face 查看

排行第十二:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2352,趋势分 241。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2352 · 趋势分 241)
在 Hugging Face 查看

论文

排行第一:视频生成模型:后期训练与对齐综述
该文综述了视频生成模型在后期训练和对齐方面的研究进展,探讨了如何提升模型对人类意图的理解、时间连贯性及物理约束满足度,分析了视频生成中对齐的独特挑战。(论文赞 6)
在 Hugging Face 查看

排行第二:人格剂量控制:分级特质调控的校准激活引导
该研究提出PersonaDose方法,通过特质描述和请求强度控制语言模型的人格表达,利用校准激活引导实现更精细的特质控制,提升核心特质表达效果。(论文赞 2)
在 Hugging Face 查看

排行第三:Transformer过早停止思考,微调LoRA可修复
研究发现预训练Transformer在上下文引用上计算深度不足,通过在早期层添加微调LoRA可显著提升其处理长链任务的能力,实现更高效的信息传递与计算。(论文赞 2)
在 Hugging Face 查看

排行第四:蜂窝结构:视频世界模型的恒定场景记忆表示
提出Honeycomb模型,利用固定大小的场景记忆结构存储视频特征,通过低秩表示和多平面融合实现长期视频生成中的一致性与高效存储。(论文赞 1)
在 Hugging Face 查看

排行第五:X-Tree:可复用经验的标记化与高效代理泛化
该文提出X-Tree方法,通过标记化可复用经验,从数据中恢复任务结构并进行训练,提升代理在复杂任务中的泛化能力,无需依赖大语言模型调用。(论文赞 3)
在 Hugging Face 查看

排行第六:OpenTumorBoard:多学科肿瘤病例讨论基准
构建OpenTumorBoard基准,包含611个病例和19157个讨论回合,模拟真实肿瘤病例讨论流程,评估大模型在临床讨论和治疗建议中的表现。(论文赞 5)
在 Hugging Face 查看

排行第七:关键词触发工具使用:小语言模型工具使用声明的廉价诊断方法
关键词匹配基准可能错误地认为小模型执行了工具使用。我们通过西班牙语安全语言模型的匹配架构对这一问题进行了记录,并提出了一种严格且廉价的诊断方法。661.6M参数模型和1,109M参数模型在解码器、分词器和特殊标记上共享,但在宽松的工具使用指标上得分相近。通过训练示例的逐字检查,可以完全区分这两个模型:600M模型在6个示例中都能生成有效的工具调用,而1B模型在所有示例中均未能做到。
在 Hugging Face 查看

排行第八:ScholarCatalyst:启发新研究的论文检索基准
什么使伟大的科学家变得伟大?尽管AI系统开始在开放问题上取得进展,科学家们仍能更早地感知到哪些先前的研究想法能推动新问题的解决。我们通过研究人员亲身经历的项目进展来研究这一技能,将论文作为其中想法的指针。利用我们自动化的标注流程,我们构建了ScholarCatalyst,由184位207篇近期计算机科学论文的作者标注哪些候选论文对他们的项目有所启发,并附上详细理由。我们引入了一个基于作者提供的标注的检索任务。(论文赞 4)
在 Hugging Face 查看

排行第九:策略学习还是离策略学习?一种系统性研究蒸馏动态的方法
有研究认为,策略学习可以减少灾难性遗忘,产生更稀疏的参数更新,并提升泛化能力。然而,现有对监督微调与强化学习的比较通常同时改变多个因素,难以单独分析策略的影响。我们通过控制强到弱的蒸馏设置,对Llama3和Qwen2.5模型家族及涵盖科学、医学和算术领域的推理任务进行系统研究,独立调整策略、KL散度方向和学习率,以分析策略对蒸馏动态的影响。(论文赞 37)
在 Hugging Face 查看

排行第十:RLE-Bench:作为机器人学习工程师的编码代理资格考试
编码代理正在从纯数字任务转向解决物理世界中的挑战,特别是在机器人领域。然而,现有机器人基准主要关注单个组件的性能,如策略或控制器,难以全面评估编码代理的工程能力。现实中的机器人学习不仅涉及控制,还需构建、集成、诊断和优化异构组件,并在资源限制下从多模态反馈中进行推理。为此,我们引入了RLE-Bench,一个涵盖四个代表性机器人开发流程的基准,用于评估编码代理的工程能力。(论文赞 5)
在 Hugging Face 查看

排行第十一:SemanTok:用于高效自回归视频生成的可预测语义标记
基于视频的世界模型结合了自回归预测的可扩展性与扩散模型的视觉质量。场景标记器的选择对这两种模型的性能至关重要,包括保真度和语义性。灵活长度、由粗到细的标记器能够实现这一点:初始的粗标记携带视频的全局语义,后续标记进一步细化细节。现有灵活标记器仅在早期解码器隐藏状态上应用表示对齐损失,而解码器可以通过其噪声输入部分满足该目标。我们引入了SemanTok,一种灵活的视频标记器,将冻结的DINO特征输入其编码器,以提升语义表达。(论文赞 4)
在 Hugging Face 查看

排行第十二:Where-OPD:利用合成场景进行多模态大语言模型的空间引导策略自蒸馏
策略自蒸馏最近被提出作为提升语言模型推理能力的有效方法,通过使用冻结或EMA版本的自身模型进行监督,该模型可获得特权信息。然而,其在多模态大语言模型(MLLMs)中的应用仍较少。现有方法使用特权视觉信息,如与问题相关的图像裁剪,以提升细粒度感知能力,但其效果局限于需要此类视觉聚焦的任务,并依赖于人工标注的定位数据或外部教师模型。我们提出了一种适用于MLLMs的策略自蒸馏方法,为教师模型提供不同的信息引导。(论文赞 7)
在 Hugging Face 查看



扫描二维码,在手机上阅读

X榜单(2026年10月03日 03:51 北京时间)

swyx:顺便说一下,别忘了他们一直在做的那个“还有一个事情...”他…

评 论
评论已关闭