Hugging Face 模型趋势榜和每日论文。
模型
排行第一:Audio8-ASR-Infinite(语音识别)
Hugging Face 趋势榜上的模型,任务类型是语音识别,点赞 1734,趋势分 1453。标签:audio8_asr_infinite、text-generation、streaming、realtime、speech-recognition。(点赞 1734 · 趋势分 1453)
在 Hugging Face 查看
排行第二:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4635,趋势分 1442。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4635 · 趋势分 1442)
在 Hugging Face 查看
排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2524,趋势分 875。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2524 · 趋势分 875)
在 Hugging Face 查看
排行第四:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1032,趋势分 861。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 1032 · 趋势分 861)
在 Hugging Face 查看
排行第五:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2708,趋势分 581。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2708 · 趋势分 581)
在 Hugging Face 查看
排行第六:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 561,趋势分 552。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 561 · 趋势分 552)
在 Hugging Face 查看
排行第七:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 549,趋势分 446。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 549 · 趋势分 446)
在 Hugging Face 查看
排行第八:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16635,趋势分 368。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16635 · 趋势分 368)
在 Hugging Face 查看
排行第九:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5678,趋势分 355。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5678 · 趋势分 355)
在 Hugging Face 查看
排行第十:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2295,趋势分 328。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2295 · 趋势分 328)
在 Hugging Face 查看
排行第十一:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 446,趋势分 317。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 446 · 趋势分 317)
在 Hugging Face 查看
排行第十二:Julia-1(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 311,趋势分 301。标签:decision-model、multilingual、routing、base_model:jhu-clsp/mmBERT-small、base_model:finetune:jhu-clsp/mmBERT-small。(点赞 311 · 趋势分 301)
在 Hugging Face 查看
论文
排行第一:分数状态空间转移用于长序列建模
状态空间模型(SSMs)通过将序列历史压缩到一个有界循环状态中,使其记忆规律成为长上下文性能的关键架构选择。大多数现代SSMs依赖基于常微分方程的动力学,导致指数遗忘,限制了其在广泛时间范围内的信息保留能力。我们引入FRAC,一种基于分数动力学的选择性SSM架构,用幂律长记忆替代指数衰减。为了使分数动力学实用化,FRAC用有限状态、对数间隔的指数模式之和来近似重尾目标核。这种构造将分数记忆转化为高效的循环模块。(论文赞 3)
在 Hugging Face 查看
排行第二:周期性弱点:分块KV缓存压缩的相位敏感性
分块KV缓存压缩通过以固定步长将连续的token窗口压缩为更少的缓存条目,减少长上下文推理的内存和注意力成本。这种压缩还引入了一个新的位置坐标:token的相位,即其相对于压缩窗口边界的相对位置。我们发现使用这种压缩的模型存在系统性不对称性:相同的信息在某一相位容易检索,在另一相位则难以检索。我们将这种检索性能的周期性变化称为相位敏感性。在具有这种压缩的大型开放权重模型中,不同相位的长上下文检索准确率可能相差高达40个百分点。(论文赞 50)
在 Hugging Face 查看
排行第三:Org-Agent:超越个人助手的组织代理
为组织服务的语言模型代理需要协调多个用户请求,同时利用分布在交互中的知识。我们确定了该场景下的两种互补能力,即跨用户交互和决策能力,以及跨用户记忆和知识使用能力。这些能力受到组织约束的三个方面的控制:用户身份、权限和访问许可;信息的归属和时间有效性;以及解决跨用户冲突需求和联合决策需求的规则。这些约束决定了在采取某个行动之前必须获取哪些信息或做出哪些决策。(论文赞 1)
在 Hugging Face 查看
排行第四:代理能否为其他代理设计库?
代理越来越多地依赖其他代理编写的代码,并倾向于重新实现而非复用,从而增加了后续代理必须处理的代码库规模。为了衡量代理为其他代理设计库的能力,我们引入了LibraryDesignBench,这是一个两阶段的基准测试,其中代理根据定义所需功能和潜在使用场景的规范,实现一个完整的库,而不规定具体设计。我们通过三个来自不同模型家族的用户代理编写程序的正确性和简洁性来评估该库。该基准测试涵盖了四个语言中15个库设计任务的242个专家验证的编程问题。在15个任务中的11个中,代理的表现显(论文赞 3)
在 Hugging Face 查看
排行第五:同源策略下策略蒸馏的扩展特性
强化学习(RL)可以赋予大语言模型(LLMs)显著的推理能力,但这种能力在不同模型规模之间的转移程度和速度尚不清楚。我们研究了在弱到强、同源和强到弱的教师-学生设置下,策略蒸馏(OPD)的扩展特性。我们发现早期OPD训练动态普遍表现出一种规律的有用转移阶段,其中保留准确率(黄金得分G)随着d=KL(π_θ||π_ref)(学生初始化的token级反向KL散度的平方根)近似线性增长。在所有观察到的弱到强配对中,学生的性能均显示出一定的规律性。(论文赞 5)
在 Hugging Face 查看
排行第六:持续学习的学习动态:数据归属、遗忘与可塑性损失的统一视角
现代语言模型在其生命周期中可能多次更新,而非一次性训练后冻结。因此,每次更新都参与一个循环过程:决定从哪些经验中学习,理解该更新带来的变化,并保持从后续内容中学习的能力。我们表明,这些挑战由相同的更新-行为交互所控制。我们推导出一种逐token和逐层的分解方法,说明从一个token学习如何改变另一个预测。通过分离softmax力、共享输出几何结构和残差连接,它揭示了两个交互通道,并提供了一个可前向计算的近似方法。通过追踪这种交互,我们能够分析模型在持续学习中的动态变化。(论文赞 1)
在 Hugging Face 查看
排行第七:循环变压器中的递归推理调度
递归推理模型在扩展测试时间计算方面引起了越来越多的关注,通常通过迭代地使用共享参数细化潜在状态。然而,这些模型对每个学习更新应用固定的单位规模,这可能在持续进步的更新中过于保守,在波动较大的更新中过于激进,限制了额外循环的好处。为了理解沿轨迹应该如何变化尺度,我们首先分析终端损失对递归更新尺度的敏感性。我们证明其时间平均可以分解为持续进步和中心波动贡献。基于此,我们引入了轨迹调度器。(论文赞 9)
在 Hugging Face 查看
排行第八:ALICE: 基于互信息估计的在上下文、零样本场景下的互信息
估计互信息(MI)从样本是各种科学领域的中心目标。现代神经估计器在大数据 regime 中准确,但在数据稀缺时表现不佳,每个分布都必须单独拟合。现有技术还受限于特定的数据类型。这些限制限制了它们在许多应用中的采用,其中每分布的训练是不切实际的,且样本大小很小。我们介绍了ALICE,一个基础模型,无需每分布训练即可实现竞争性的互信息估计。训练仅限于一个广泛的合成分布族,ALICE作为在上下文估计器运作,提供对每个分布的精确互信息估计。(论文赞 1)
在 Hugging Face 查看
排行第九:LIFT: 通过自蒸馏实现大视角变化下的布局未来视频生成
我们介绍了LIFT,一个统一的图像到视频生成框架,通过补充相机控制实现布局未来控制,使用户能够指定未来视图中应出现的内容及其位置。这解决了可控视频生成的实际需求:给定初始图像,用户不仅关心相机的移动方式,还关心关键未来时刻的场景内容,特别是最后一帧。现有技术仅指定视角轨迹,而文本提示仅提供粗略语义指导;两者都不能精确确定未来视图的内容和空间布局。这种局限性在大幅视角变化的情况下尤为明显。(论文赞 6)
在 Hugging Face 查看
排行第十:FocusVTC: 通过自适应分辨率打破视觉文本压缩的性能权衡
在大型语言模型的长上下文推理中,计算和内存成本显著增加。视觉文本压缩(VTC)通过将文本渲染为图像来减少输入长度,但固定分辨率渲染创建了压缩性能权衡:低DPI节省令牌,但牺牲可读性;高DPI则花费令牌在无关内容上。我们介绍了FocusVTC,它通过自适应分辨率打破了这一权衡,同时保留了通用多模态能力。它结合了压缩的低DPI全局视图和选择性区域增强,将增强视图集成到持续推理中。我们构建了29.4K高质量的推理-证据局部化(REL)链-of-thought数据集。(论文赞 13)
在 Hugging Face 查看
排行第十一:路由应为此付费:经济高效的LLM路由稀疏监督
大型语言模型(LLM)路由通过将每个查询分配到适当的模型来降低服务成本,同时保持响应质量。学习这样的路由器通常需要执行多个候选模型的历史查询,以收集查询-模型质量反馈,这在实际部署前需要付出显著的监督成本。现有工作大多关注服务时间效率,而忽视了结果节省是否足以回收前期投入。我们进一步观察到,路由质量往往在收集所有查询-模型反馈之前就已饱和,暗示密集监督可能过度提供。我们提出了SaveRouter,一个经济高效的LLM路由方法,通过稀疏监督实现。(论文赞 7)
在 Hugging Face 查看
排行第十二:PMOPD: 多教师在线策略蒸馏中的任务排序、循环和参数更新子空间保护
多教师在线策略蒸馏(MOPD)已成为集成前沿语言模型特殊能力的流行后训练范式。现有OPD研究主要关注单任务蒸馏通过目标设计、蒸馏范围和教师信号构造,而MOPD必须在共享参数中聚合多个能力,并解决能力跷跷板现象,即提高一个领域会抑制从另一个领域获得的能力。我们受到OPE更新几何特性的启发,发现MOPD中不同任务的参数更新迅速在其各自的低维子空间中集中。(论文赞 3)
在 Hugging Face 查看
