Hugging Face 模型趋势榜和每日论文。
模型
排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4982,趋势分 1057。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4982 · 趋势分 1057)
在 Hugging Face 查看
排行第二:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2827,趋势分 757。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2827 · 趋势分 757)
在 Hugging Face 查看
排行第三:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 751,趋势分 724。标签:qwen3_5、clef、cloudflare、systemone、qwen3.8。(点赞 751 · 趋势分 724)
在 Hugging Face 查看
排行第四:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 660,趋势分 402。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 660 · 趋势分 402)
在 Hugging Face 查看
排行第五:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5970,趋势分 385。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5970 · 趋势分 385)
在 Hugging Face 查看
排行第六:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2830,趋势分 381。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2830 · 趋势分 381)
在 Hugging Face 查看
排行第七:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16786,趋势分 349。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16786 · 趋势分 349)
在 Hugging Face 查看
排行第八:Julia-1(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 364,趋势分 348。标签:decision-model、multilingual、routing、base_model:jhu-clsp/mmBERT-small、base_model:finetune:jhu-clsp/mmBERT-small。(点赞 364 · 趋势分 348)
在 Hugging Face 查看
排行第九:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 532,趋势分 282。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 532 · 趋势分 282)
在 Hugging Face 查看
排行第十:VisionHOPE(图像分类)
Hugging Face 趋势榜上的模型,任务类型是图像分类,点赞 373,趋势分 259。标签:computer-vision、visionhope。(点赞 373 · 趋势分 259)
在 Hugging Face 查看
排行第十一:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 622,趋势分 256。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 622 · 趋势分 256)
在 Hugging Face 查看
排行第十二:clef-flash(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 249,趋势分 244。标签:qwen3_5、clef、cloudflare、systemone、qwen3.5。(点赞 249 · 趋势分 244)
在 Hugging Face 查看
论文
排行第一:MemFold:基于在线优化的长上下文个性化软记忆学习
该研究提出MemFold模型,通过行为优化固定预算的软记忆,解决长期上下文个性化问题。传统方法在保留信息和利用信息之间缺乏有效平衡,而MemFold通过优化记忆支持的行为,实现更高效的个性化响应。
在 Hugging Face 查看
排行第二:视频生成模型:后训练与对齐策略综述
本文综述了视频生成模型的后训练与对齐技术。尽管预训练模型具备强大生成能力,但其在遵循人类意图、保持时间一致性等方面仍存在不足。文章分析了视频生成对齐的独特挑战并提出系统性策略。(论文赞 8)
在 Hugging Face 查看
排行第三:人格剂量:分级特质控制的校准激活引导方法
该研究提出PersonaDose方法,通过特质描述和请求强度控制语言模型的人格表达。通过校准激活引导控制器的时间参数,实现对人格特质的精确控制,显著提升核心特质表达效果。(论文赞 2)
在 Hugging Face 查看
排行第四:Transformer思考过早停止,微小LoRA可修复
研究发现预训练Transformer在上下文参考处理上使用深度有限,通过在早期层添加秩为8的LoRA微调,可显著提升长链推理准确率,从15.5%提升至99%,验证了LoRA在增强模型推理能力方面的潜力。(论文赞 2)
在 Hugging Face 查看
排行第五:蜂窝结构:视频世界模型的恒定场景记忆表示
该研究提出Honeycomb框架,基于HexMemory实现固定大小的场景记忆表示。通过六层空间和时空平面存储场景特征,实现视频生成中的一致性保持,避免了存储需求随生成过程增长的问题。(论文赞 1)
在 Hugging Face 查看
排行第六:X-Tree:可重用经验的标记化用于高效代理泛化
该研究提出X-Tree方法,通过标记化可重用经验实现高效代理泛化。不同于传统平坦动作流训练,该方法从数据中恢复层次结构并进行训练,无需LLM调用即可实现更好的泛化性能。(论文赞 10)
在 Hugging Face 查看
排行第七:OpenTumorBoard:多学科肿瘤会诊讨论轨迹的现实基准
多学科肿瘤会诊通过专家讨论整合多模态临床观察和长期患者病史,但现有基准很少能捕捉这些现实轨迹。我们引入OpenTumorBoard,一个包含611个患者案例和19,157次讨论回合的基准,涵盖十个专家角色,数据转录自YouTube上公开的12,534分钟肿瘤会诊录音。该基准评估两种场景:SPECIALIST TURN,即语言模型回应真实讨论中提出的临床重要问题;BOARD SIMULATION,即生成完整的讨论过程并达成治疗建议的共识。(论文赞 5)
在 Hugging Face 查看
排行第八:关键词利用失效:小语言模型工具使用声明的廉价诊断阶梯
关键词匹配基准可能会错误地给小模型赋予其从未执行过的工具使用能力。我们记录了一对西班牙语安全语言模型中的此类误判,并提出一套严格的廉价诊断阶梯。一个6.616亿参数的模型(约65%代码/技术文本;无专门的监督微调)和一个11.09亿参数的模型(以网络为主的多阶段课程;60亿token的工具微调)共享解码器、分词器和特殊标记,在宽松的工具使用指标上得分几乎相同(B4:0.660 vs. 0.650)。对训练示例的逐字检查可完全区分两者:6亿参数模型在6个示例中均能生成有效的工具(论文赞 1)
在 Hugging Face 查看
排行第九:ScholarCatalyst:检索启发新研究的论文基准
是什么让伟大的科学家变得伟大?尽管AI系统开始在开放问题上取得进展,科学家们仍能领先于AI,识别出哪些被埋藏在不断增长的研究档案中的先前观点能推动新问题的解决。为了研究这一技能,我们参考了那些亲身知道哪些早期工作推动其已完成项目的研究人员,以论文作为指向其中观点的指针。通过我们的自动化流程,使作者标注规模化,我们构建了ScholarCatalyst,由207篇近期计算机科学论文的184位主要作者标注哪些候选论文确实或可能推动其项目,并附有详细理由。我们引入了一个检索任务,使用(论文赞 5)
在 Hugging Face 查看
排行第十:策略学习还是离线策略学习?一项关于蒸馏动态的系统研究
策略学习被认为可以减少灾难性遗忘、产生更稀疏的参数更新并提高泛化能力。然而,现有对监督微调和强化学习的比较通常同时改变多个因素,使得策略滚动的贡献难以分离。我们在一个受控的强到弱蒸馏设置中研究策略滚动的影响,通过独立调整策略滚动、token级KL方向和学习率,覆盖Llama3和Qwen2.5模型家族以及科学、医学和算术领域的推理任务。我们的分析揭示了蒸馏动态的复杂图景,其中策略滚动在不同条件下表现出不同的效果。(论文赞 89)
在 Hugging Face 查看
排行第十一:RLE-Bench:作为机器人学习工程师的编码代理资格考试
编码代理开始超越纯数字任务,解决现实世界中的机器人挑战。然而,现有机器人基准主要关注单个组件(如策略或控制器)的性能,对编码代理更广泛的工程能力覆盖有限。现实世界的机器人技术不仅限于控制:代理必须在资源限制下构建、集成、诊断和改进异构组件,并从多模态反馈中进行推理。为了评估这些更广泛的能力,我们引入了RLE-Bench,一个涵盖四个代表性机器人开发流程的机器人学习任务基准:交互控制、系统集成、故障诊断和性能优化。(论文赞 5)
在 Hugging Face 查看
排行第十二:SemanTok:用于高效自回归视频生成的可预测语义标记
近期基于视频的世界模型结合了自回归(AR)预测的可扩展性和扩散模型的视觉质量。场景标记器的选择对于这些模型的最优性能至关重要,无论是在保真度还是语义方面。灵活长度、从粗到细的标记器能够实现这一点:初始粗略标记承载视频的全局语义,后续标记进一步细化细节。现有灵活标记器仅在早期解码器隐藏状态上应用表示对齐(REPA)损失,而解码器可以从其噪声输入部分满足该目标。我们引入了SemanTok,一种灵活的视频标记器,将冻结的DINO特征输入其编码器,以提高语义可预测性并优化视频生成效率(论文赞 4)
在 Hugging Face 查看
