Hugging Face 模型趋势榜和每日论文。
模型
排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4469,趋势分 1939。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4469 · 趋势分 1939)
在 Hugging Face 查看
排行第二:Audio8-ASR-Infinite(语音识别)
Hugging Face 趋势榜上的模型,任务类型是语音识别,点赞 1476,趋势分 1298。标签:audio8_asr_infinite、text-generation、streaming、realtime、speech-recognition。(点赞 1476 · 趋势分 1298)
在 Hugging Face 查看
排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2383,趋势分 1140。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2383 · 趋势分 1140)
在 Hugging Face 查看
排行第四:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2643,趋势分 775。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2643 · 趋势分 775)
在 Hugging Face 查看
排行第五:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 859,趋势分 725。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 859 · 趋势分 725)
在 Hugging Face 查看
排行第六:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 514,趋势分 507。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 514 · 趋势分 507)
在 Hugging Face 查看
排行第七:Xing4.0-29B-A4B(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 1807,趋势分 496。标签:xing4_0、conversational、custom_code。(点赞 1807 · 趋势分 496)
在 Hugging Face 查看
排行第八:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 499,趋势分 482。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 499 · 趋势分 482)
在 Hugging Face 查看
排行第九:ZDTaichu5.0-9B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1947,趋势分 397。标签:zdtaichu5_0、multimodal、vision-language-model、spatial-reasoning、agent。(点赞 1947 · 趋势分 397)
在 Hugging Face 查看
排行第十:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 411,趋势分 396。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 411 · 趋势分 396)
在 Hugging Face 查看
排行第十一:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2258,趋势分 383。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2258 · 趋势分 383)
在 Hugging Face 查看
排行第十二:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16542,趋势分 368。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16542 · 趋势分 368)
在 Hugging Face 查看
论文
排行第一:SentZero:一种增强的句子中心视觉-语言预训练方法用于多任务零样本胸部X光
视觉-语言(VL)预训练通过配对胸部X光(CXR)图像和放射学报告,展现出强大的医学图像理解潜力。然而,现有方法通常仍依赖于特定任务的微调,因为放射学报告内容冗长、临床信息密集,且难以与简单的零样本提示对齐。近期的句子级方法部分解决了这一限制,利用大语言模型(LLMs)提取的临床短语,但大多忽略了放射学话语的内在特性。特别是,正样本对的多样性有限,制约了进一步的提升,而临床等价句子在不同患者中频繁重复,导致...(论文赞 24)
在 Hugging Face 查看
排行第二:谁获得了一个标记,它又承载了什么?大语言模型中姓名支持与概念访问的不平等
姓名是个人标识符,但它们也承载着社会意义,并被广泛用于评估语言模型如何对待不同的人。此类评估通常假设匹配的姓名是可比的模型输入。我们证明,这一假设在词汇接口上经常失败:匹配的姓名不一定是匹配的输入。一些姓名可以直接通过单个标记访问,而另一些则由多个子词组成,导致姓名表层支持的不平等。在近五十万个名字和12种与大语言模型相关的标记器中,直接词汇访问具有高度选择性、模型依赖性,并在与种族和性别相关的名字元数据中存在显著差异。我们引入了NameTrace,...(论文赞 1)
在 Hugging Face 查看
排行第三:VisionHOPE:视觉主干作为自我修改的学习系统
视觉主干已从具有局部聚合的卷积神经网络(CNNs)发展为具有全局交互的视觉变换器(ViTs)、具有输入依赖状态转移的状态空间模型(SSMs)以及在处理图像时适应内部学习器的测试时训练(TTT)层。在这一发展过程中,视觉计算对每个输入的适应性不断增强,但这种适应性的规则主要由训练好的主干所规定。我们引入了VisionHOPE,这是首个将视觉主干作为自我修改学习系统的通用框架,其中模型所记住的内容和其学习方式在图像处理过程中共同演变。基于自回归的...(论文赞 106)
在 Hugging Face 查看
排行第四:通过夜科学强化智能体在科学构想中的创造力
大语言模型(LLMs)在结构化、可验证的任务中表现出色,但其低熵偏见可能导致输出同质化和可预测性,从而限制其在开放性科学构想中的应用。然而,有效的科学发现涵盖更广泛的创造性范畴:从结构化的日间科学到松散结构、偶然发现的夜间科学,后者能触及通常未被考虑的创意。我们引入了AI夜科学家,一个基于强化学习的智能体框架,用于训练模型何时以及如何偏离可预测的推理。基于认知科学,我们从三个维度建模创造力:行为(做什么以及如何创造性地做)、过程(何时探索与何时解释)、...(论文赞 2)
在 Hugging Face 查看
排行第五:几何作为地址:用于长时程摄像头控制视频生成的视觉记忆注意力路由
长时程摄像头控制视频生成需要从不断增长的视觉历史中恢复之前观察到的内容。现有方法要么隐式地搜索历史上下文,要么将其重建为持久的3D记忆,但都面临记忆访问效率低下或几何误差累积的问题。我们的关键见解是,几何无需解释场景,只需确定从哪里读取视觉记忆,而注意力机制决定恢复什么内容。基于这一见解,我们引入了GEAR,一种几何驱动的注意力路由框架,将几何作为视觉记忆的显式标记级地址。该方法不将历史观察融合到持久的...(论文赞 2)
在 Hugging Face 查看
排行第六:SCOPD:用于高效视觉-语言模型的稀疏上下文策略梯度自蒸馏
推理视觉-语言模型(VLMs)将图像和视频处理为长序列的视觉标记,导致推理成本高昂。无训练标记剪枝可以降低这一成本,但过度压缩可能会显著降低性能,通常归因于任务相关视觉信息的不可逆丢失。我们证明,这一解释并不完整。在固定上下文Pass@K分析中,从相同的剪枝视觉表示中重复采样可以恢复许多贪心解码所遗漏的示例,表明有用视觉证据可能仍然可访问,但未被可靠利用。我们称这一现象为表示-利用差距。受此启发,我们引入了SCOPD,一种稀疏上下文策略梯度自蒸馏方法,...(论文赞 2)
在 Hugging Face 查看
排行第七:Pruned CTC降低内存消耗
连接时序分类(CTC)自然支持离线及流式语音识别,通过语束级监督,但传统实现会材料化帧级词汇激活,导致内存密集型。关键观察是,每个有效的CTC对齐仅使用目标词和空白符,其批量并集通常仅为全词汇的小部分。我们引入Pruned CTC,将对齐计算限制在此子集,同时保留全词汇归一化。证明该词汇减少与完整CTC在损失上等价。(论文赞 2)
在 Hugging Face 查看
排行第八:AnswerMap: 视觉原理由输出后验构建
当VLM回答视觉查询时,现有解释工具依赖文本理由,使用不匹配的模态,或依赖内部读取,这些读取过早,需要对模型的白盒访问。我们引入AnswerMap,一种无监督、任务无关的视觉原理由输出头构建。将图像切割成K行和K列,每个与查询以是/否相关问题的格式单独展示给冻结模型。外积行和列“是”后验给出查询条件的空间映射。关键在于,通过定义固定读取R(例如,期望、最大值)在AnswerMap之上。(论文赞 2)
在 Hugging Face 查看
排行第九:强化学习后蒸馏攻击防御
蒸馏攻击复制封闭大型语言模型的推理能力,允许攻击者以低成本复制顶尖性能。攻击者系统收集前沿模型推理轨迹,然后在其上训练(即“蒸馏”)自己的模型。现有防御评估在蒸馏后立即进行,隐含攻击者不会进一步训练模型。现实威胁模型包括蒸馏后进一步用强化学习训练。误指定威胁模型可产生虚假安全感——一些防御措施可能无效。(论文赞 1)
在 Hugging Face 查看
排行第十:FactorEngram: 基于基的层级门控n-gram记忆
基于查找的记忆一直是扩展大型语言模型(LLM)参数的有效方式。它检索局部令牌模式的 learned representations,如n-gram,而不是通过连续层计算重构。然而,现有设计如Engram将每个检索嵌入视为单体单元。每个嵌入存储在单独的哈希槽中,并由单一标量门控调制。因此,多义词无法选择性读取相关内存组件。此外,参数仅在哈希碰撞中共享,与语义无关。我们提出FactorEngram,通过因子分解n-gram记忆,实现更细粒度的记忆访问。(论文赞 2)
在 Hugging Face 查看
排行第十一:GPT-6 Astra在计算机视觉中的跨领域表现
前沿通用系统在视觉理解外迅速扩展至处理传统计算机视觉模型的能力。随着这些能力扩展,计算机视觉社区的核心问题之一是这种扩展延伸多远,以及什么仍然困难。我们在GPT-6 Astra与五个前沿通用AI系统 across 34 capabilities and 55 benchmarks spanning nine areas of computer vision. 我们比较其与专用模型和人类的表现,其中适合参考。(论文赞 12)
在 Hugging Face 查看
排行第十二:DISCO: 通过解耦推理与长上下文实现分布式扩展
虽然大型语言模型(LLMs)宣称支持百万令牌上下文窗口,但推理质量随输入增大而下降的现象称为上下文旋转。这种失败源于单体架构中的结构纠缠,其中巨大的搜索负担消耗了解决复杂推理所需的表示能力。为解决此,我们提出通过解耦推理与长上下文实现分布式扩展(DISCO)。Inspired by distributed computing frameworks like Apache Spark,DISCO将长上下文分割到一组专用Worker LLM进行并行局部推理。一个中央Driver (论文赞 2)
在 Hugging Face 查看
