Hugging Face 模型趋势榜和每日论文。
模型
排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4479,趋势分 1896。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4479 · 趋势分 1896)
在 Hugging Face 查看
排行第二:Audio8-ASR-Infinite(语音识别)
Hugging Face 趋势榜上的模型,任务类型是语音识别,点赞 1479,趋势分 1300。标签:audio8_asr_infinite、text-generation、streaming、realtime、speech-recognition。(点赞 1479 · 趋势分 1300)
在 Hugging Face 查看
排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2392,趋势分 1121。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2392 · 趋势分 1121)
在 Hugging Face 查看
排行第四:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2644,趋势分 754。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2644 · 趋势分 754)
在 Hugging Face 查看
排行第五:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 861,趋势分 727。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 861 · 趋势分 727)
在 Hugging Face 查看
排行第六:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 517,趋势分 509。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 517 · 趋势分 509)
在 Hugging Face 查看
排行第七:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 504,趋势分 486。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 504 · 趋势分 486)
在 Hugging Face 查看
排行第八:Xing4.0-29B-A4B(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 1807,趋势分 477。标签:xing4_0、conversational、custom_code。(点赞 1807 · 趋势分 477)
在 Hugging Face 查看
排行第九:ZDTaichu5.0-9B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1947,趋势分 397。标签:zdtaichu5_0、multimodal、vision-language-model、spatial-reasoning、agent。(点赞 1947 · 趋势分 397)
在 Hugging Face 查看
排行第十:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 414,趋势分 396。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 414 · 趋势分 396)
在 Hugging Face 查看
排行第十一:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2258,趋势分 374。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2258 · 趋势分 374)
在 Hugging Face 查看
排行第十二:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16552,趋势分 364。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16552 · 趋势分 364)
在 Hugging Face 查看
论文
排行第一:SentZero:一种增强的句子中心视觉-语言预训练方法用于多任务零样本胸部X光
视觉-语言预训练通过配对胸部X光图像和放射学报告,展现出在医学图像理解方面的强大潜力。然而,现有方法通常仍依赖于特定任务的微调,因为放射学报告内容冗长、临床信息密集,且难以与简单的零样本提示对齐。近期的句子级方法部分解决了这一限制,使用大型语言模型提取的临床短语,但大多忽略了放射学话语的内在特征。特别是,正样本对的多样性有限,限制了进一步的提升,而临床等价的句子在不同患者中频繁出现,导致...(论文赞 25)
在 Hugging Face 查看
排行第二:谁获得了一个标记,它又承载了什么?大型语言模型中姓名支持与概念访问的不平等
姓名是个人标识符,但它们也承载着社会意义,并被广泛用于评估语言模型如何对待不同的人。此类评估通常假设匹配的姓名是可比较的模型输入。我们证明这一假设在词汇层面经常失效:匹配的姓名不一定是匹配的输入。一些姓名可以直接通过单个标记访问,而另一些则由多个子词组合而成,导致姓名表层支持的不平等。在近五十万个名字和12种与大型语言模型相关的标记化器中,直接的词汇访问高度选择性、依赖模型,并且在与种族和性别相关的姓名元数据中分布不均。我们引入了NameTrace,...(论文赞 1)
在 Hugging Face 查看
排行第三:VisionHOPE:视觉主干作为自我修改的学习系统
视觉主干从具有局部聚合的卷积神经网络(CNN)发展到具有全局交互的视觉变换器(ViTs)、具有输入依赖状态转换的状态空间模型(SSMs)以及在处理图像时适应内部学习器的测试时训练(TTT)层。在这一演变过程中,视觉计算越来越适应每个输入,但这种适应的规则大多由训练好的主干所规定。我们引入了VisionHOPE,这是首个将视觉主干作为自我修改学习系统的通用框架,其中模型记住的内容和学习方式在图像处理过程中共同演化。基于自回归的...(论文赞 106)
在 Hugging Face 查看
排行第四:通过夜科学强化智能体在科学构想中的创造力
大型语言模型(LLMs)在结构化和可验证的任务中表现出色,但其低熵偏差可能导致输出同质化和可预测性,限制了其在开放性科学构想中的应用。然而,有效的科学发现涵盖更广泛的创造性维度:从结构化的日间科学到松散结构、偶然发现的夜间科学,后者可以产生超出通常考虑范围的构想。我们引入了AI夜科学家,一个基于强化学习的智能体框架,用于训练模型何时以及如何偏离可预测的推理。基于认知科学,我们沿三个维度建模创造力:动作(做什么以及如何创造性地做)、过程(何时探索与何时解释)...(论文赞 2)
在 Hugging Face 查看
排行第五:几何作为地址:用于长时程摄像头控制视频生成的视觉记忆注意力路由
长时程摄像头控制视频生成需要从不断增长的视觉历史中恢复之前观察到的内容。现有方法要么隐式地搜索历史上下文,要么将其重建为持久的3D记忆,但面临记忆访问效率低下或几何误差累积的问题。我们的关键见解是,几何无需解释场景,只需确定从哪里读取视觉记忆,而注意力机制决定恢复什么内容。基于这一见解,我们引入了GEAR,一种几何驱动的注意力路由框架,该框架将几何作为显式的标记级地址来访问视觉记忆。而不是将历史观察融合到一个持久的...(论文赞 2)
在 Hugging Face 查看
排行第六:SCOPD:用于高效视觉-语言模型的稀疏上下文策略梯度自蒸馏
推理视觉-语言模型(VLMs)将图像和视频处理为长序列的视觉标记,导致推理成本高昂。无训练标记剪枝可以降低这一成本,但过度压缩可能会显著降低性能,通常归因于任务相关视觉信息的不可逆丢失。我们证明这一解释并不完整。在固定上下文Pass@K分析中,从相同的剪枝后的视觉表示中重复采样可以恢复许多贪心解码所遗漏的示例,表明有用视觉证据仍可访问,但未被可靠利用。我们称这种现象为表示-利用差距。受此观察启发,我们引入了SCOPD,一种稀疏上下文策略梯度自蒸馏方法,...(论文赞 2)
在 Hugging Face 查看
排行第七:剪枝CTC实现内存高效的大词汇表ASR训练
连接时序分类(CTC)自然支持离线和流式语音识别,具有逐句监督,但传统实现方法会材料化帧逐词汇激活,导致内存密集,使得使用原生大词汇表进行CTC训练变得不可承受。一个关键观察是,每个有效的CTC对齐仅使用目标词汇和空白符,它们在一个批次中的并集通常只占完整词汇表的一小部分。我们引入了剪枝CTC,将对齐计算限制在这个子集,同时保留完整词汇表的归一化。证明在损失方面,剪枝CTC与完整词汇表的CTC是等价的。(论文赞 2)
在 Hugging Face 查看
排行第八:AnswerMap:从答案后验中构建可信的空间解释
当VLM回答视觉查询时,当前使用的解释工具依赖于文本理由,这些理由使用了不匹配的模态,或者依赖于内部读取,这些读取起源于模型过早的位置,无法反映最终输出,并且需要白盒访问。我们引入了AnswerMap,这是一种训练-free、任务无关的黑盒视觉理由,通过输出头构建。图像被切割成K行和K列,每个都与查询一起显示为“是/否”相关问题的格式。行的“yes”后验和列的“yes”后验的外积给出查询条件化的空间地图。关键在于,通过定义一个固定的读取R(例如,期望、最大值)在AnswerM(论文赞 2)
在 Hugging Face 查看
排行第九:强化学习后蒸馏防御易被攻破
蒸馏攻击复制封闭的大语言模型(LLM)的推理能力,允许攻击者以低成本复制最先进性能。攻击者系统地收集大量前沿模型推理轨迹,然后在这些轨迹上训练(即“蒸馏”)自己的模型。现有防御蒸馏攻击的方法通常立即进行评估,隐含假设攻击者不会进一步训练模型。一个更现实的威胁模型包括在使用强化学习进一步训练后蒸馏防御。一个未指定的威胁模型可能会给人一种虚假的安全感——一些防御措施可能不足以应对这种进一步训练。(论文赞 1)
在 Hugging Face 查看
排行第十:FactorEngram:通过基级门控实现N-gram记忆的因子分解
基于查找的记忆一直是扩展大型语言模型(LLM)参数的一种有希望的方法。它检索学习过的局部令牌模式(如n-gram)的表示,而不是通过连续的层计算重构它们。然而,现有设计如Engram将每个检索的嵌入视为一个整体。每个嵌入存储在各自的哈希槽中,并由单个标量门控调制。因此,多义词模式无法选择性读取其记忆中与上下文相关的组件。此外,参数仅在哈希碰撞中共享,这些碰撞与语义关系不大。我们提出了FactorEngram,一种通过基级门控实现n-gram记忆的因子分解方法。(论文赞 2)
在 Hugging Face 查看
排行第十一:GPT-6 Astra揭示计算机视觉跨领域能力
前沿通用系统正在迅速扩展,从视觉理解扩展到传统由专用计算机视觉模型处理的能力。随着这些能力的扩展,计算机视觉社区的一个中心问题是这种扩展延伸多远,以及什么仍然难以实现。我们在34种能力和55个基准测试中评估了GPT-6 Astra,这些测试覆盖了九个计算机视觉领域,并与专用模型和人类进行比较,其中适合参考的地方。人类。在Astra中展示了广泛的视觉能力,在视觉和空间推理以及几种形式的计算机视觉任务中取得了显著进展。(论文赞 13)
在 Hugging Face 查看
排行第十二:DISCO:通过地面-推理解耦实现长上下文分布式扩展
虽然大型语言模型(LLMs)宣称拥有百万token的上下文窗口,但随着输入的增长,其推理质量往往崩溃,这被称为上下文旋转。这种失败源于单体架构中的结构性纠缠,其中大量的上下文搜索负担耗尽了复杂推理所需的表示能力。为了解决这个问题,我们提出了地面-推理解耦,通过DIStributed long COntext scaling(DISCO)实现灵感来自分布式计算框架如Apache Spark。DISCO将长上下文分区分配给一组专用的Worker LLM,每个Worker专注于局部(论文赞 2)
在 Hugging Face 查看
