HF榜单(2026年09月30日 23:15 北京时间)


laya(文本分类)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4607,趋势分 1497。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4607 · 趋势分 1497)
在 Hugging Face 查看

排行第二:Audio8-ASR-Infinite(语音识别)
Hugging Face 趋势榜上的模型,任务类型是语音识别,点赞 1617,趋势分 1394。标签:audio8_asr_infinite、text-generation、streaming、realtime、speech-recognition。(点赞 1617 · 趋势分 1394)
在 Hugging Face 查看

排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2504,趋势分 903。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2504 · 趋势分 903)
在 Hugging Face 查看

排行第四:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 995,趋势分 853。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 995 · 趋势分 853)
在 Hugging Face 查看

排行第五:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2697,趋势分 599。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2697 · 趋势分 599)
在 Hugging Face 查看

排行第六:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 552,趋势分 543。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 552 · 趋势分 543)
在 Hugging Face 查看

排行第七:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 540,趋势分 517。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 540 · 趋势分 517)
在 Hugging Face 查看

排行第八:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16619,趋势分 360。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16619 · 趋势分 360)
在 Hugging Face 查看

排行第九:Xing4.0-29B-A4B(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 1812,趋势分 349。标签:xing4_0、conversational、custom_code。(点赞 1812 · 趋势分 349)
在 Hugging Face 查看

排行第十:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5634,趋势分 345。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5634 · 趋势分 345)
在 Hugging Face 查看

排行第十一:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2292,趋势分 339。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2292 · 趋势分 339)
在 Hugging Face 查看

排行第十二:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 441,趋势分 328。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 441 · 趋势分 328)
在 Hugging Face 查看

论文

排行第一:ALICE:上下文内、零样本、互信息估计
从样本中估计互信息(MI)是多种科学领域的重要目标。现代神经网络估计器在大数据环境下准确,但在数据稀缺时表现不佳,且需为每种分布重新训练。现有估计器还局限于特定数据类型。这些限制使得在许多需要逐分布训练不现实且样本量小的应用中难以采用。我们提出了ALICE,一种基础模型,无需逐分布训练,同时实现具有竞争力的估计精度。ALICE仅在广泛的合成分布上进行训练,作为上下文内的估计器进行操作。(论文赞 1)
在 Hugging Face 查看

排行第二:LIFT:通过策略自蒸馏实现大视角变化下的布局在未来视频生成
我们引入了LIFT,一个统一的图像到视频生成框架,通过布局在未来(Layout-In-FuTure)控制补充相机控制,使用户能够指定未来视角中应出现的内容及其位置。这解决了可控视频生成中的一个实际需求:给定初始图像,用户不仅关心相机如何移动,还关心关键未来时刻场景应呈现的样子,尤其是最后一帧。现有的相机控制指定视角轨迹,而文本提示仅提供粗略的语义指导;两者都无法精确确定未来视角的内容和空间布局。这一限制在大视角变化的情况下尤为明显。(论文赞 6)
在 Hugging Face 查看

排行第三:FocusVTC:通过自适应分辨率实现高效且高性能的视觉文本压缩
大语言模型的长上下文推理会产生显著的计算和内存成本。视觉文本压缩(VTC)通过将文本渲染为图像来减少输入长度,但固定分辨率渲染导致压缩性能之间的权衡:低DPI节省了标记,但牺牲了可读性;高DPI则在无关内容上消耗了标记。我们引入了FocusVTC,通过自适应分辨率打破这一权衡,同时保留通用的多模态能力。它结合了压缩的低DPI全局视图和选择性区域增强,将增强视图整合到推理过程中。我们构建了29.4K高质量的推理-证据定位(REL)推理链数据集。(论文赞 6)
在 Hugging Face 查看

排行第四:路由应自付其费:经济高效的LLM路由的稀疏监督
大语言模型(LLM)路由通过将每个查询分配给合适的模型来降低服务成本,同时保持响应质量。然而,学习这样的路由器通常需要在历史查询上执行多个候选模型以收集查询-模型质量反馈,这在部署前会产生不小的监督成本。现有工作主要关注服务时的效率,忽略了节省的成本是否足以弥补前期支出。我们进一步观察到,路由质量通常在收集所有查询-模型反馈之前就趋于饱和,表明密集监督可能在经济上被过度配置。我们提出了SaveRouter,以解决这一问题。(论文赞 4)
在 Hugging Face 查看

排行第五:PMOPD:多教师策略下多任务排序、循环和参数更新子空间保护
多教师策略下在线政策蒸馏(MOPD)已成为一种流行的后训练范式,用于整合前沿语言模型中的专业能力。现有在线政策蒸馏(OPD)研究主要集中在通过目标设计、蒸馏范围和教师信号构建来优化单任务蒸馏,而MOPD需要在共享参数中聚合多种能力,并解决由此产生的能力跷跷板问题,即提升一个领域会抑制另一个领域所获得的能力。受OPD独特更新几何的启发,我们发现不同任务的参数更新在MOPD过程中迅速集中在各自的低维子空间中,(论文赞 3)
在 Hugging Face 查看

排行第六:改进的分布扩散模型
分布扩散模型(DDMs)通过使用基于评分规则目标训练的分布去噪器,取代标准的均值预测去噪器,学习对p(x_1 mid x_t)的随机近似,而非其条件均值。然而,将DDMs扩展到现代图像生成场景面临两个障碍:(i)多粒子训练的开销随粒子数量增加而增长,(ii)DDMs使用全局固定的评分规则超参数,在采样预算上强制单一权衡。我们通过将粒子扩展延迟到后期Transformer层,并引入时间相关的评分规则计划来缓解这些限制。(论文赞 3)
在 Hugging Face 查看

排行第七:AutoRef: 优化代理多参考图像生成
最近图像生成模型可以接受多个参考图像作为输入并将其组合成新图像。然而,多参考图像生成仍然具有挑战性:模型可能会遗漏或重复参考图像中的主体,或者生成多个主体在图像中 unnaturally 粘贴的情况。最近的工作提出了一种图像生成代理,该代理结合图像生成模型、推理模型和一个夹具,夹具是一个可执行程序,指定如何解释参考图像、如何执行生成、如何诊断输出以及如何选择最终图像。在多参考生成中,参考图像扮演不同的角色,生成的输出必须满足最大约束。(论文赞 8)
在 Hugging Face 查看

排行第八:支架思维:优化潜在视觉目标表示以进行多模态推理
潜在推理通过两阶段训练范式推进了多模态推理:在第一阶段,一个辅助图像被编码为潜在标记,以在监督微调(SFT)阶段教给视觉链式推理;在第二阶段,这些潜在标记通过奖励反馈在强化学习(RL)阶段进一步精炼。在本文中,我们确定这种框架在两个阶段中的两个关键限制。第一,SFT阶段通常依赖于现成的视觉编码器来编码辅助图像,产生次优的潜在表示,这些表示可能与下游推理任务不完全对齐。第二,现有RL方法仅将潜在组件视为通过确定性操作进行变换的有限组件,我们提出了一种新的框架ReImaGin,利(论文赞 1)
在 Hugging Face 查看

排行第九:APM-Bench:基准测试跨会话持久记忆用于预算主动测试时间适应
为了成为真正的个人助理,流媒体视频模型需要持久记忆,能够保留过去的经验以备后用。然而,现有流媒体基准和方法通常关注单个连续视频或短片段,忽视了现实世界交互往往是间歇性的,需要记忆在中断之间持续存在。为此,我们引入了APM-Bench,将现实世界的流式交互重新定义为多会话生活轨迹。它包含549个会话,104条轨迹和2,719个候选者,涵盖客观和开放式问题。每个会话是一段带有细粒度注释的视频,会话 within 轨迹围绕一个中心主题旋转。(论文赞 17)
在 Hugging Face 查看

排行第十:用图像生成进行推理
链式推理已通过大型语言模型(LLMs)在自然语言处理领域取得了革命性的进展,使它们能够将问题分解为中间步骤后再回答。然而,将推理局限于文本领域对需要直接操作视觉表示的任务构成了限制。最近的工作将多模态LLMs与外部视觉专家工具(如深度估计或目标检测模块)结合,但这些方法仍然 fundamentally 依赖于狭窄、刚性的操作,无法灵活地生成或转换视觉内容。我们提出了一种新的框架ReImaGin,利用图像生成模型作为多模态推理的灵活视觉推理机制。(论文赞 9)
在 Hugging Face 查看

排行第十一:WISE-ATTA:在预算主动测试时间适应中何时请求标签
主动测试时间适应(ATTA)通过更新部署中的模型并在推理过程中选择性查询监督来提高对分布偏移的鲁棒性。然而,现有的大多数ATTA方法隐含地假设监督可以为每个传入的测试批次请求,这可能会在长时间的测试流中产生 substantial 注销成本。在这项工作中,我们引入了预算主动测试时间适应,其中监督仅对测试批次的一小部分可用。这种形式将中心挑战从决定每个批次中要标注的内容,转移到决定如何在时间上应用监督。为此,我们提出了一种预算感知方法WISE-ATTA,该方法分配监督以优化长期(论文赞 2)
在 Hugging Face 查看

排行第十二:LLMs是通用异步代理
现代LLMs作为自主代理的能力日益增强,但它们遵循顺序交互周期:读取、思考、回复或调用工具,重复进行。许多现实世界的用例不是顺序的:语音助手、具身代理和监控系统在思考或执行另一项任务时接收新的输入。现代LLMs通过专门架构解决了这一问题,例如语音交互、机器人控制、API使用的异步工具调用等。在这项工作中,我们将从不同异步任务推广到通用异步代理,该代理可以适应不同类型的并发。我们开发了一个异步LLM框架,允许以非顺序方式处理输入。(论文赞 33)
在 Hugging Face 查看



扫描二维码,在手机上阅读

Trump Truth:唐纳德·J·特朗普的新媒体帖子(发布于2026年9月30日上…

OpenAI推理之父:数学是多智能体开胃菜

评 论
评论已关闭