HF榜单(2026年09月30日 20:15 北京时间)


laya(文本分类)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4590,趋势分 1563。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4590 · 趋势分 1563)
在 Hugging Face 查看

排行第二:Audio8-ASR-Infinite(语音识别)
Hugging Face 趋势榜上的模型,任务类型是语音识别,点赞 1566,趋势分 1372。标签:audio8_asr_infinite、text-generation、streaming、realtime、speech-recognition。(点赞 1566 · 趋势分 1372)
在 Hugging Face 查看

排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2488,趋势分 943。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2488 · 趋势分 943)
在 Hugging Face 查看

排行第四:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 963,趋势分 825。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 963 · 趋势分 825)
在 Hugging Face 查看

排行第五:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2688,趋势分 622。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2688 · 趋势分 622)
在 Hugging Face 查看

排行第六:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 549,趋势分 540。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 549 · 趋势分 540)
在 Hugging Face 查看

排行第七:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 536,趋势分 516。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 536 · 趋势分 516)
在 Hugging Face 查看

排行第八:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16606,趋势分 354。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16606 · 趋势分 354)
在 Hugging Face 查看

排行第九:Xing4.0-29B-A4B(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 1810,趋势分 354。标签:xing4_0、conversational、custom_code。(点赞 1810 · 趋势分 354)
在 Hugging Face 查看

排行第十:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2287,趋势分 345。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2287 · 趋势分 345)
在 Hugging Face 查看

排行第十一:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 437,趋势分 342。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 437 · 趋势分 342)
在 Hugging Face 查看

排行第十二:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5612,趋势分 341。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5612 · 趋势分 341)
在 Hugging Face 查看

论文

排行第一:AutoRef: 利用优化代理进行多参考图像生成
近期图像生成模型可以接受多个参考图像作为输入并组合成新图像。然而,多参考图像生成仍然具有挑战性:模型可能会遗漏或重复参考图像中的主体,或者生成在多个主体之间不自然地粘贴的图像。最近的工作提出了一种图像生成代理,它结合了图像生成模型、推理模型和一个代理,该代理指定如何解释参考图像、如何执行生成、如何诊断输出以及如何选择最终图像。在多参考生成中,参考图像扮演不同的角色,生成的输出必须满足最大匹配原则。(论文赞 6)
在 Hugging Face 查看

排行第二:支架思维:优化潜在视觉目标表示以进行多模态推理
潜在推理通过两阶段训练范式推动了多模态推理的发展:首先,通过监督微调(SFT)阶段将辅助图像编码为潜在标记,教授视觉链式思维;其次,这些潜在标记在强化学习(RL)阶段通过奖励反馈进一步精炼。在本文中,我们识别了该框架在两个阶段的关键限制。第一,SFT阶段通常依赖于现成的视觉编码器将辅助图像编码为潜在表示 yielding suboptimal latent representations,可能无法很好地与下游推理任务对齐。第二,现有RL方法仅通过确定性操作处理潜在组件,这限制
在 Hugging Face 查看

排行第三:APM-Bench:为预算有限的主动测试时间适应中的持续记忆优化基准
为了成为真正的个人助理,流媒体视频模型需要保留过去经验的持续记忆。然而,现有流媒体基准和方法通常关注单个连续视频或短时间片段,忽视了现实世界交互往往是间歇性的,需要记忆在中断之间持续存在。为了填补这一空白,我们引入了APM-Bench,将现实世界的流式交互重新定义为多会话的生活轨迹。它包含549个会话,104个轨迹和2,719个候选者,涵盖客观和开放性问题。每个会话是一段带有细粒度注释的视频,会话 within a trajectory围绕一个中心主题旋转。(论文赞 13)
在 Hugging Face 查看

排行第四:用图像生成进行推理
链式思维推理已经通过大型语言模型(LLMs)改变了自然语言处理,使它们能够将问题分解为中间步骤再回答。然而,将推理限制在文本领域对需要直接操作视觉表示的任务构成了限制。最近的工作通过附加外部视觉专家工具(如深度估计或目标检测模块)来增强多模态LLMs,但这些方法仍然 fundamentally limited by their reliance on narrow, rigid operations that cannot flexibly生成或转换视觉内容。我们提出了一种新(论文赞 7)
在 Hugging Face 查看

排行第五:WISE-ATTA:在预算有限的主动测试时间适应中何时请求标签
主动测试时间适应(ATTA)通过更新部署中的模型并在推理期间选择性请求监督来提高对分布偏移的鲁棒性。然而,现有ATTA方法通常隐式假设可以对每个传入的测试批次请求监督,这在长时间测试流中会产生 substantial 注销成本。在这项工作中,我们引入了预算化ATTA,其中监督仅对测试批次的一小部分可用。这种形式将中心挑战从决定每个批次中要标注的内容转变为决定随时间监督应何时应用。为了解决这一挑战,我们提出了一种预算感知方法WISE-ATTA,该方法分配监督策略以优化长期性能。(论文赞 1)
在 Hugging Face 查看

排行第六:LLMs是通用异步代理
现代LLMs作为自主代理的能力日益增强,但它们遵循顺序交互周期:读取、思考、回复或调用工具,重复进行。许多现实世界应用不是顺序的:语音助手、具身代理和监控系统在思考或执行另一项任务时接收新输入。LLMs通过专门架构解决了这一问题,如语音交互和视频流、VLAs用于机器人控制、异步工具调用用于API使用等。在这项工作中,我们将从不同异步任务推广到通用异步代理,该代理可以适应不同类型的并发。我们开发了一个异步LLM框架来实现这一目标。(论文赞 21)
在 Hugging Face 查看

排行第七:持久性强制:利用像素空间扩散中的特征专业化
本文提出在像素空间扩散Transformer中引入异构细化机制,以解决其隐藏表示在深度上通常进行均匀细化的问题。自然图像本质上是按不同粒度组织的,全局结构可以紧凑表示,而局部纹理和细节需要更丰富的表示。通过为不同特征组分配不同的细化预算,实现了有序特征专业化:稀疏细化特征主要编码全局视觉结构,而更频繁细化的特征则处理局部细节。(论文赞 2)
在 Hugging Face 查看

排行第八:主动性的内容:横向与纵向主动行为研究
本文研究工具使用代理的主动性内容,而非仅关注是否或何时行动。横向主动性追求当前上下文已识别的未陈述信息,纵向主动性则基于早期证据揭示的需求。通过从基准分解中恢复需求图,记录需求间的依赖关系,从而可以从交互记录中评分这两种主动性形式以及代理是否在适当时机停止行动。(论文赞 12)
在 Hugging Face 查看

排行第九:SEAD:工具使用代理中攻击与防御的状态视角
本文从部分可观测状态控制的角度形式化工具使用代理的攻击与防御。由于早期行动可能改变外部系统状态,使得后续看似常规的行动变得有害,但可见交互可能未揭示评估行动所需的基础状态。攻击者DART将有害目标分解为局部合理步骤,利用工具执行反馈指导轨迹搜索;防御者则必须在执行前基于有限信息做出决策。(论文赞 1)
在 Hugging Face 查看

排行第十:自然语言自编码器中最具信息量词元选择
本文研究在自然语言自编码器中,为理解潜在威胁,应检查哪些词元位置以生成可读解释。通过分析470万条关于提示注入和隐藏的解释,比较模型计算信号与仅基于聊天结构的排序器。聊天结构通常能选择更相关的解释,无需模型前向传播进行位置选择。在四个数据集的三个上,仅解释5%的位置即可保留近乎全部成功率。(论文赞 7)
在 Hugging Face 查看

排行第十一:AnyStep-WAM:预算对齐蒸馏与自适应推理
本文提出AnyStep世界行动模型框架,用于可调预算预测和场景依赖计算分配。操纵任务包含对生成错误敏感度不同的动作块:关键动作需要精确性,而不敏感动作允许用更少去噪步骤快速生成。通过预算对齐的教师轨迹蒸馏,训练区间条件流图,使用显式冻结教师转移和共享低秩适配器,支持动作生成。(论文赞 2)
在 Hugging Face 查看

排行第十二:StoryEngine:基于状态的视频叙事代理框架
本文提出StoryEngine,一个基于状态的视频叙事代理框架,以解决现有代理管道缺乏明确机制传播故事事件后果和维护视频世界状态的问题。这导致缺失视觉细节可能被不准确重建,视觉漂移在后续镜头中传播,破坏叙事连贯性和视觉一致性。StoryEngine建立独立的世界状态表示,跨镜头跟踪事件影响,确保长故事的一致生成。(论文赞 8)
在 Hugging Face 查看



扫描二维码,在手机上阅读

X榜单(2026年09月30日 20:48 北京时间)

X榜单(2026年09月30日 20:15 北京时间)

评 论
评论已关闭