Hugging Face 模型趋势榜和每日论文。
模型
排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4922,趋势分 1098。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4922 · 趋势分 1098)
在 Hugging Face 查看
排行第二:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1256,趋势分 879。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 1256 · 趋势分 879)
在 Hugging Face 查看
排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2780,趋势分 756。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2780 · 趋势分 756)
在 Hugging Face 查看
排行第四:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 622,趋势分 614。标签:qwen3_5、clef、cloudflare、systemone、qwen3.8。(点赞 622 · 趋势分 614)
在 Hugging Face 查看
排行第五:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 636,趋势分 403。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 636 · 趋势分 403)
在 Hugging Face 查看
排行第六:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2816,趋势分 401。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2816 · 趋势分 401)
在 Hugging Face 查看
排行第七:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5917,趋势分 372。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5917 · 趋势分 372)
在 Hugging Face 查看
排行第八:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16756,趋势分 343。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16756 · 趋势分 343)
在 Hugging Face 查看
排行第九:Julia-1(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 355,趋势分 340。标签:decision-model、multilingual、routing、base_model:jhu-clsp/mmBERT-small、base_model:finetune:jhu-clsp/mmBERT-small。(点赞 355 · 趋势分 340)
在 Hugging Face 查看
排行第十:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 518,趋势分 283。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 518 · 趋势分 283)
在 Hugging Face 查看
排行第十一:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 614,趋势分 262。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 614 · 趋势分 262)
在 Hugging Face 查看
排行第十二:VisionHOPE(图像分类)
Hugging Face 趋势榜上的模型,任务类型是图像分类,点赞 363,趋势分 255。标签:computer-vision、visionhope。(点赞 363 · 趋势分 255)
在 Hugging Face 查看
论文
排行第一:SemanTok:面向高效自回归视频生成的可预测语义令牌
近期视频世界模型结合自回归预测的扩展性与扩散模型的视觉质量,场景令牌器对性能至关重要。现有灵活令牌器仅对早期解码器隐藏状态应用表示对齐损失(易被噪声输入影响),而SemanTok是一种灵活视频令牌器,将冻结的DINO特征输入编码器,旨在优化语义和保真度。
在 Hugging Face 查看
排行第二:Where-OPD:基于合成场景的MLLMs空间引导策略自蒸馏
策略自蒸馏能提升语言模型推理,但在多模态大语言模型(MLLMs)中应用有限。现有方法依赖特权视觉信息(如问题对应图像裁剪),需人工标注或外部教师,且增益限于特定任务。Where-OPD引入MLLMs的新型策略自蒸馏,通过合成场景提供空间引导,避免上述限制。(论文赞 4)
在 Hugging Face 查看
排行第三:循环变压器解码更优且几乎无额外成本
循环变压器通过重复共享块实现参数高效,但标准解码会丢弃早期循环的中间表示。早期循环计算量小,能提供对齐的弱强预测对。LoopCD是无训练的对比解码框架,通过对比最终预测与早期循环结果引导令牌选择,可在日志空间或隐藏空间运行,提升效果。(论文赞 4)
在 Hugging Face 查看
排行第四:OTRetarget:基于最优传输的机器人与物体运动联合重定向
将人类运动转移到类人机器人需适应形态,同时保留环境交互(如地面和物体接触)。骨骼运动不足以描述交互,固定物体轨迹限制新形态适应。OTRetarget是统一方法,通过符号距离表示表面交互,联合重定向人类示范中的机器人和多物体运动。(论文赞 2)
在 Hugging Face 查看
排行第五:JevSpawn:通过组合动作空间实现自适应智能体推理
LLM智能体逐令牌生成推理和动作,交互慢且昂贵。Jev模型需提前指定预测字段,限制自主任务解决。JevSpawn是组合策略,连接自然语言任务与有限概率探索,结合并行动作生成、反馈驱动分支选择等,实现自适应推理。(论文赞 1)
在 Hugging Face 查看
排行第六:Architect-Ant:建筑平面图的可编辑自动家具布置
带家具的平面图支持房地产可视化等,但自动布置面临真实数据不足及几何功能约束。AntPlan是含505个真实专业平面图的数据集(92类家具、10类房间),Architect-Ant框架实现无需迭代推理的约束感知布局生成,并支持可编辑。(论文赞 6)
在 Hugging Face 查看
排行第七:内部干预机制审计:LLM工具使用中的修正与修复
本文提出SAKIKO审计框架,通过方向性错误发现、路由器条件干预、目标解析验证和前瞻性冻结统计许可,分析LLM在调用外部工具前的决策机制,揭示内部激活调控对预执行决策的影响及潜在副作用。(论文赞 1)
在 Hugging Face 查看
排行第八:LOCI:流式世界模型的空间线性记忆
LOCI是一种混合空间记忆架构,结合关键值缓存和循环记忆,实现对过去观测的长期保留和当前视角的精准检索,解决视频世界模型中记忆扩展与历史信息可访问性之间的矛盾。(论文赞 3)
在 Hugging Face 查看
排行第九:PhysVista:基于感知-推理-评估循环的物理智能基准
PhysVista是一个评估视觉语言模型物理智能的基准,通过感知、推理和物理判断的闭环框架,系统性检验模型对真实世界动态物理一致性的理解能力。(论文赞 7)
在 Hugging Face 查看
排行第十:Latent-Foresight:可预测潜在表征的端到端学习
该研究提出一种端到端方法,直接在视觉基础模型特征空间中学习可预测的潜在表示,避免传统两阶段方法中表示学习与时间预测的解耦问题。
在 Hugging Face 查看
排行第十一:泛化即稳定性:LLM的多维评估
本文提出从个体样本、多种输入变体和模型行为不同维度评估大语言模型的泛化能力,强调稳定性而非单一准确率,以更全面地衡量模型在不同表达方式下的输出一致性。(论文赞 4)
在 Hugging Face 查看
排行第十二:通过权重正交化移除LLM中的后门
NEEDLE是一种无需训练的后门移除方法,通过激活向量估计后门方向和拒绝子空间,利用权重正交化抑制后门行为,同时避免对正常输出分布的干扰。(论文赞 4)
在 Hugging Face 查看
