HF榜单(2026年10月09日 12:15 北京时间)


JEV-27B-VL(图文理解)

Hugging Face 模型趋势榜和每日论文。

模型

排行第一:JEV-27B-VL(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 3021,趋势分 2508。标签:qwen3_5、jev、system-one、system-two、typed-decisions。(点赞 3021 · 趋势分 2508)
在 Hugging Face 查看

排行第二:GEV-26B-Decide(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 1883,趋势分 1616。标签:gemma4、image-text-to-text、system-one、system-two、adaptive-thinking。(点赞 1883 · 趋势分 1616)
在 Hugging Face 查看

排行第三:clef(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 1897,趋势分 1322。标签:qwen3_5、clef、cloudflare、systemone、decision-model。(点赞 1897 · 趋势分 1322)
在 Hugging Face 查看

排行第四:embeddinggemma-2(特征提取)
Hugging Face 趋势榜上的模型,任务类型是特征提取,点赞 1215,趋势分 1179。标签:embedding_gemma2、embedding、sentence-transformers、multimodal-embedding、multimodal。(点赞 1215 · 趋势分 1179)
在 Hugging Face 查看

排行第五:Kolibri-1(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 816,趋势分 752。标签:vllm、kolibri1、reasoning、moe、conversational。(点赞 816 · 趋势分 752)
在 Hugging Face 查看

排行第六:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 3687,趋势分 674。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 3687 · 趋势分 674)
在 Hugging Face 查看

排行第七:Xing4.0-29B-A4B-GGUF(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 669,趋势分 617。标签:xing4_0、conversational、custom_code、base_model:XingChen-AGI/Xing4.0-29B-A4B、base_model:quantized:XingChen-AGI/Xing4.0-29B-A4B。(点赞 669 · 趋势分 617)
在 Hugging Face 查看

排行第八:humanizer(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 634,趋势分 593。标签:gemma4_unified、image-text-to-text、humanizer、text-rewriting、rewriting。(点赞 634 · 趋势分 593)
在 Hugging Face 查看

排行第九:clef-flash(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 695,趋势分 500。标签:qwen3_5、clef、cloudflare、systemone、decision-model。(点赞 695 · 趋势分 500)
在 Hugging Face 查看

排行第十:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 6959,趋势分 494。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 6959 · 趋势分 494)
在 Hugging Face 查看

排行第十一:GLM5.3-Flash-E224-DGX-Spark(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 442,趋势分 403。标签:vllm、glm5_next、autotrust、moe、nvfp4。(点赞 442 · 趋势分 403)
在 Hugging Face 查看

排行第十二:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 5395,趋势分 378。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 5395 · 趋势分 378)
在 Hugging Face 查看

论文

排行第一:LLMs是否理解序列结构?推理与生成的受控研究
本研究通过受控实验探讨大型语言模型(LLMs)能否恢复潜在的序列结构,而不仅仅是表面动作频率。使用双人石头剪刀布交互和单玩家随机n-gram延续任务,测试LLMs识别潜在策略、遵循简单马尔可夫规则及维持高阶条件依赖的能力。框架区分分布匹配与条件结构理解,对行为模拟至关重要。
在 Hugging Face 查看

排行第二:多智能体自我中心世界模型与细粒度交互
针对多智能体在共享环境中通过细粒度动作交互的场景,提出多智能体自我中心世界建模框架。将问题定义为同步生成多个智能体的自我流,要求跨视图动作一致性、共享环境一致性和交互引发状态的一致传播。现有模型多关注粗粒度动作,本研究探索细粒度具身交互的建模挑战。(论文赞 8)
在 Hugging Face 查看

排行第三:OneSearch-VL:统一多模态图像与视频深度研究智能体
提出OneSearch-VL统一智能体,基于视觉接地证据图(VGEG)编码单图、多图和视频任务中的依赖关系。VGEG作为共享任务级参考,支持数据构建、过程监督和操作级评估。数据引擎构建并验证多图和视频问题,过滤专家轨迹,旨在保持视觉锚点、实体关系、源支持事实和答案生成操作间的依赖。(论文赞 3)
在 Hugging Face 查看

排行第四:蒸馏路由3D特权用于VLM空间推理
针对视觉语言模型(VLMs)空间推理弱点,提出几何特权蒸馏(GPD)方法。利用3D扫描源提供的几何证据作为特权,在策略自蒸馏中纠正感知错误。对每个问题,结合深度、语义和鸟瞰视图路由几何线索,避免推理时注入3D的架构和延迟成本,直接利用训练语料中的真实几何信息。
在 Hugging Face 查看

排行第五:TerraVis:基于MLLM评估文本到图像世界一致性
提出TerraVis框架,评估生成图像的世界基础视觉一致性。定义结构化分类法,涵盖对象级、交互级和场景级一致性违规。采用多模态大语言模型工作流系统检查生成图像,弥补现有保真度、美学、偏好或对齐指标的不足,针对物体结构畸形、不可能解剖、物理不可行交互等现实合理性违规。(论文赞 1)
在 Hugging Face 查看

排行第六:TestPrism:重新思考超越单一参考的测试评估
针对LLM编码智能体测试生成评估忽略替代有效实现的问题,提出TestPrism基准。包含300个测试任务和3000个候选实现,均分有效和无效解。主要指标联合成功函数要求生成测试在初始程序状态失败,接受所有有效候选,拒绝所有无效候选。基线配置下该指标仅达28.00%,凸显单一参考评估的局限性。(论文赞 5)
在 Hugging Face 查看

排行第七:SparseEngine:稀疏优先推理引擎
SparseEngine是一种从零开始设计的稀疏优先推理引擎,通过共享生命周期契约让不同方法控制其KV表示和计算,同时与通用服务基础设施协调状态转换。它支持15种方法,涵盖四个类别,并通过链式缓存实现跨请求状态管理。(论文赞 3)
在 Hugging Face 查看

排行第八:SpaceCast-Bench:预测空间推理评估
SpaceCast-Bench是首个直接诊断性评估视觉语言模型预测空间推理能力的基准。它基于观察-变换-推断框架,包含3862个问题,来自182个真实场景,涵盖16种任务类型,逐步要求场景理解、空间状态更新和关系推理。(论文赞 2)
在 Hugging Face 查看

排行第九:ViSkill:视觉原生技能强化VLM代理
ViSkill是一种视觉原生技能学习框架,将成功交互编码为复合视觉技能卡,供VLM代理直接访问。检索到的技能指导推理和奖励塑造,同时成功轨迹用于持续优化技能和策略,提升样本效率。(论文赞 2)
在 Hugging Face 查看

排行第十:Learn2Play Bench:LLM代理学习评估
Learn2Play Bench是一个新设计的文本游戏基准,其规则新颖或反直觉,要求代理通过交互获取知识。该基准旨在区分代理从经验中学习与利用已有知识进行推理的能力,评估其在陌生动态环境中的适应性。(论文赞 18)
在 Hugging Face 查看

排行第十一:DreamTrue:动作忠实机器人世界模型
DreamTrue是一种多视角跨实体机器人世界模型,用于动作忠实且物理上合理的视频预测。它通过离线几何校准对齐动作轨迹与目标视频,并引入反事实后训练,扩展交互覆盖范围,提升预测的准确性和多样性。(论文赞 14)
在 Hugging Face 查看

排行第十二:SpatialOPSD:自蒸馏空间智能
SpatialOPSD是一种基于策略的自蒸馏框架,通过提示MLLM总结空间编码代理的执行轨迹,激发其内部空间思维链。该框架旨在将代理能力内化,使MLLM无需外部工具即可进行空间推理。(论文赞 2)
在 Hugging Face 查看



扫描二维码,在手机上阅读

热榜(2026年10月09日 12:15 北京时间)

HN榜单(2026年10月09日 12:15 北京时间)

评 论
评论已关闭