Hugging Face 模型趋势榜和每日论文。
模型
排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4943,趋势分 1077。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4943 · 趋势分 1077)
在 Hugging Face 查看
排行第二:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2800,趋势分 756。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2800 · 趋势分 756)
在 Hugging Face 查看
排行第三:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 684,趋势分 674。标签:qwen3_5、clef、cloudflare、systemone、qwen3.8。(点赞 684 · 趋势分 674)
在 Hugging Face 查看
排行第四:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 645,趋势分 402。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 645 · 趋势分 402)
在 Hugging Face 查看
排行第五:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5941,趋势分 385。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5941 · 趋势分 385)
在 Hugging Face 查看
排行第六:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2821,趋势分 385。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2821 · 趋势分 385)
在 Hugging Face 查看
排行第七:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16773,趋势分 351。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16773 · 趋势分 351)
在 Hugging Face 查看
排行第八:Julia-1(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 362,趋势分 347。标签:decision-model、multilingual、routing、base_model:jhu-clsp/mmBERT-small、base_model:finetune:jhu-clsp/mmBERT-small。(点赞 362 · 趋势分 347)
在 Hugging Face 查看
排行第九:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 527,趋势分 281。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 527 · 趋势分 281)
在 Hugging Face 查看
排行第十:VisionHOPE(图像分类)
Hugging Face 趋势榜上的模型,任务类型是图像分类,点赞 366,趋势分 258。标签:computer-vision、visionhope。(点赞 366 · 趋势分 258)
在 Hugging Face 查看
排行第十一:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 619,趋势分 257。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 619 · 趋势分 257)
在 Hugging Face 查看
排行第十二:Ternary-Bonsai-2-27B-gguf(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 2350,趋势分 240。标签:llama.cpp、ternary、2-bit、cuda、metal。(点赞 2350 · 趋势分 240)
在 Hugging Face 查看
论文
排行第一:Honeycomb:用于视频世界模型的恒定场景记忆表示
本文提出Honeycomb视频世界模型,使用HexMemory实现固定大小的场景特征存储。通过六个空间和时空平面存储场景特征,利用前馈写入器将生成块映射到新平面特征,实现高效且一致的长期视频生成。(论文赞 1)
在 Hugging Face 查看
排行第二:X-Tree:用于高效代理泛化的可重用经验分词方法
本文提出X-Tree方法,通过识别和利用可重用的行动序列来提升代理泛化能力。不同于传统方法对所有token统一加权,该方法从数据中恢复层次结构并进行训练,无需LLM调用,提升训练效率和泛化性能。(论文赞 2)
在 Hugging Face 查看
排行第三:OpenTumorBoard:多学科肿瘤讨论轨迹的真实世界基准
本文构建OpenTumorBoard基准,包含611个患者案例和19,157个讨论回合,涵盖10个专业角色。该基准用于评估LLM在真实肿瘤讨论中的响应和模拟讨论能力,推动多学科协作研究。(论文赞 4)
在 Hugging Face 查看
排行第四:关键词陷阱失效:小语言模型工具使用诊断阶梯
本文指出关键词匹配基准可能错误地认可小模型的工具使用能力。通过构建严格但廉价的诊断阶梯,区分模型是否真正执行工具调用,揭示模型在工具使用上的真实表现差异。
在 Hugging Face 查看
排行第五:ScholarCatalyst:检索启发新研究的论文基准
本文构建ScholarCatalyst基准,通过184位作者标注207篇论文,识别哪些先前研究启发了其新项目。该基准用于评估模型在检索关键研究方面的表现,推动AI辅助科研发展。(论文赞 3)
在 Hugging Face 查看
排行第六:在线或离线学习?蒸馏动态的系统研究
本文系统研究了在强弱模型蒸馏中滚动策略对学习效果的影响。通过控制变量方法,分析不同策略在科学、医学和算术任务中的表现,揭示滚动策略在模型蒸馏中的复杂作用。(论文赞 15)
在 Hugging Face 查看
排行第七:RLE-Bench:作为机器人学习工程师的编码代理资格考试
编码代理正在从纯数字任务转向解决物理世界中的挑战,尤其是在机器人领域。然而,现有的机器人基准主要关注单个组件(如策略或控制器)的性能,对编码代理更广泛的工程能力覆盖有限。现实中的机器人学习不仅涉及控制,还需要代理在资源限制下构建、集成、诊断和改进异构组件,并从多模态反馈中进行推理。为此,我们引入了RLE-Bench,一个涵盖四个代表性机器人开发流程的机器人学习任务基准:交互式控制。(论文赞 4)
在 Hugging Face 查看
排行第八:SemanTok:用于高效自回归视频生成的可预测语义标记
基于视频的世界模型结合了自回归(AR)预测的可扩展性与扩散模型的视觉质量。场景标记器的选择对于这两种模型的性能至关重要,尤其是在保真度和语义方面。灵活长度、由粗到细的标记器能够实现这一点:初始的粗标记携带视频片段的全局语义,后续标记进一步细化细节。现有的灵活标记器仅在早期解码器隐藏状态上应用表示对齐(REPA)损失,而解码器可以通过其噪声输入部分满足这一目标。我们引入了SemanTok,一种灵活的视频标记器,通过将冻结的DINO特征输入其编码器来实现更高效的语义建模。(论文赞 4)
在 Hugging Face 查看
排行第九:Where-OPD:通过合成场景进行空间引导的多模态大语言模型在策略自蒸馏
在策略自蒸馏中,使用冻结或EMA版本的模型作为教师模型,通过特权信息监督学生模型,从而提升语言模型的推理能力。然而,这种方法在多模态大语言模型(MLLMs)中的应用仍较少。现有方法利用特权视觉信息(如与问题相关的图像裁剪)来提升细粒度感知能力,但其效果局限于需要这种视觉聚焦的任务,并且需要人工标注的地面数据或外部教师模型。我们提出了一种针对MLLMs的不同形式的策略自蒸馏方法,为教师模型提供特权信息。(论文赞 6)
在 Hugging Face 查看
排行第十:通过对比解码更好地解码循环Transformer(几乎无需额外成本)
循环Transformer通过在递归循环中重复执行共享块来实现参数效率。每个循环生成的中间表示都可以用于解码下一个标记,但标准解码方法会丢弃早期状态。由于早期循环计算量较少,递归本身自然提供了对齐的弱预测和强预测对,无需辅助模型或外部训练。我们引入了LoopCD,一种无需训练的对比解码框架,通过将最终预测与早期递归过程进行对比来引导标记选择,可在logit空间中通过一次额外输出传递(LoopCD-Logits)或在隐藏状态空间中零输出开销(LoopCD-Hidden)运行。(论文赞 10)
在 Hugging Face 查看
排行第十一:OTRetarget:通过最优传输进行机器人和物体运动的联合重定向
将人类动作转移到人形机器人上需要调整演示动作以适应机器人的形态,同时保持与环境的交互。这对于需要地面和操作对象接触一致的操控任务尤其具有挑战性。然而,仅凭骨骼动作无法完全描述这些交互,固定物体轨迹会限制对新形态的适应。本文介绍了OTRetarget,一种统一的方法,用于从人类演示中联合重定向机器人和多个物体的运动。我们的方法通过符号距离表示表面交互,从而实现更自然的动作迁移。(论文赞 2)
在 Hugging Face 查看
排行第十二:JevSpawn:通过组合动作空间进行自适应智能体推理
大语言模型代理通过逐个生成中间推理和动作标记来实现交互,这使得长时间的交互变得缓慢且计算成本高。Jev风格的模型可以快速对有限域进行概率预测,但需要提前指定这些域。这一限制使得在需要从自然语言指令中推导可用动作并根据交互进行调整的自主任务解决变得困难。我们引入了JevSpawn,一种组合策略,将自然语言任务规范与有限域的概率探索连接起来。并行动作生成与反馈驱动的分支选择、表示更新和保留替代方案的恢复相结合,实现了更高效的推理过程。(论文赞 2)
在 Hugging Face 查看
