Hugging Face 模型趋势榜和每日论文。
模型
排行第一:laya(文本分类)
Hugging Face 趋势榜上的模型,任务类型是文本分类,点赞 4536,趋势分 1701。标签:laya、system-one、calibrated-decisions、rlcd、classification。(点赞 4536 · 趋势分 1701)
在 Hugging Face 查看
排行第二:Audio8-ASR-Infinite(语音识别)
Hugging Face 趋势榜上的模型,任务类型是语音识别,点赞 1552,趋势分 1361。标签:audio8_asr_infinite、text-generation、streaming、realtime、speech-recognition。(点赞 1552 · 趋势分 1361)
在 Hugging Face 查看
排行第三:Qwen-Image-2.1-Uncensored-GGUF(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2459,趋势分 1003。标签:qwen、image-generation、comfyui、comfyui-gguf、base_model:Qwen/Qwen-Image-2.1。(点赞 2459 · 趋势分 1003)
在 Hugging Face 查看
排行第四:TeleOCR(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 889,趋势分 752。标签:qwen2_5_vl、ocr、document-parsing、multimodal、conversational。(点赞 889 · 趋势分 752)
在 Hugging Face 查看
排行第五:Qwen-Image-2.1(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 2670,趋势分 683。标签:diffusers、qwen、image-generation、image-editing、rgba。(点赞 2670 · 趋势分 683)
在 Hugging Face 查看
排行第六:CLM-v0.1-8B(text-ranking)
Hugging Face 趋势榜上的模型,任务类型是text-ranking,点赞 532,趋势分 523。标签:contrastive-lm、clm、contrastive-learning、verifier、reranker。(点赞 532 · 趋势分 523)
在 Hugging Face 查看
排行第七:Nemotron-3-Diarization(语音活动检测)
Hugging Face 趋势榜上的模型,任务类型是语音活动检测,点赞 521,趋势分 502。标签:nemo、nemotron3_diarization、audio-frame-classification、speaker-diarization、streaming-sortformer。(点赞 521 · 趋势分 502)
在 Hugging Face 查看
排行第八:ZDTaichu5.0-9B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 2000,趋势分 395。标签:zdtaichu5_0、multimodal、vision-language-model、spatial-reasoning、agent。(点赞 2000 · 趋势分 395)
在 Hugging Face 查看
排行第九:Xing4.0-29B-A4B(文本生成)
Hugging Face 趋势榜上的模型,任务类型是文本生成,点赞 1809,趋势分 369。标签:xing4_0、conversational、custom_code。(点赞 1809 · 趋势分 369)
在 Hugging Face 查看
排行第十:Qwen-Image-2.1-viggle-turbo(文生图)
Hugging Face 趋势榜上的模型,任务类型是文生图,点赞 429,趋势分 369。标签:diffusers、lora、image-to-image、image-editing、distillation。(点赞 429 · 趋势分 369)
在 Hugging Face 查看
排行第十一:LTX-2.5(image-to-video)
Hugging Face 趋势榜上的模型,任务类型是image-to-video,点赞 5590,趋势分 349。标签:diffusion-single-file、text-to-video、video-to-video、image-text-to-video、audio-to-video。(点赞 5590 · 趋势分 349)
在 Hugging Face 查看
排行第十二:Qwen3.8-27B(图文理解)
Hugging Face 趋势榜上的模型,任务类型是图文理解,点赞 16575,趋势分 349。标签:qwen3_5、conversational、eval-results、deploy:azure、deploy:sagemaker。(点赞 16575 · 趋势分 349)
在 Hugging Face 查看
论文
排行第一:Omni-IO技能:利用您的原生代理Omni-Native
通用型代理可以规划、推理并在长期范围内行动,但其生产能力仍然局限于文本、图像、音频、视频、文档、3D资产和代码等多种模态。将基础模型扩展到其他模式将使能力增长与昂贵的模型更新绑定,而组装专门模型和工具则留下如何协调程序、依赖关系、中间资产和跨回合修订的问题。我们介绍了Omni-IO技能,这是一种通过分层技能、标准化的多模态执行接口、依赖感知的编排和持续的资产注册表,使现有代理实现原生多模态性的插件式代理驾驭系统。(论文赞 8)
在 Hugging Face 查看
排行第二:超球面语义轨迹分析:从学术预印和专利信号映射技术扩散
宏观经济生产力指标,如总要素生产率,由于行政调查间隔和国家会计惯例的原因,对技术突破的报道存在多年的滞后。本文介绍了超球面语义轨迹分析(HSTA),一种无监督的定量方法,直接从非结构化的科学和商业文本流中跟踪技术扩散。我们分析了来自arXiv的30,000个过滤文档记录和来自美国专利商标局的专利申请记录。通过使用球形K均值聚类将高阶Transformer句子嵌入投影到单位超球面上,我们在八个主要领域中研究了技术扩散的主要轨迹、次要轨迹和边缘轨迹。
在 Hugging Face 查看
排行第三:上下文语言模型
我们引入了上下文语言模型(CLMs),这是一种原生管理自身上下文的语言模型。我们通过将上下文视为文件,并允许模型对这一文件进行不受限制的更新来实现这一点。这使模型能够学习什么是最重要的需要维持的上下文,并自然地扩展到多代理系统,其中多个代理上下文共存为文件。通过零-shot构建CLMs,在各种任务上优于最新的上下文管理策略:在BrowseComp-Plus上准确度提高11.4%,计算量减少21.5%;在12小时EdgeBench上准确度提高5%,计算量减少59%;在相同计算量(论文赞 5)
在 Hugging Face 查看
排行第四:Omni-Decision:基于证据的账本规划以实现多模态代理
多模态代理必须在视频、音频、网络页面和计算中寻求证据。它们的主要瓶颈是规划:嘈杂的多模态观察在对话历史中积累,干扰后来的决策,而多模态模型在多步骤规划方面的容量有限。通过受控的后端替换支持这一诊断:替换规划器会导致更大的性能损失,而替换感知后端则会导致较小的性能损失。我们介绍了Omni-Decision,这是一种基于证据的账本规划的多模态代理:它替换不断增长的对话历史,用一个明确的证据账本记录哪些证据仍需,哪些已被确认,以及在哪里需要重新获取。(论文赞 1)
在 Hugging Face 查看
排行第五:相同字节,不同权威:保留标记的聊天模板注入
当注入的指令被模型的自己的聊天模板包装时,对LLM代理的提示注入变得更强。一个伪造的模板标记如<|im_start|>可以到达模型,要么作为一个单一的保留控制标记,要么作为一个序列的普通子词令牌。这两种解码方式完全相同,由于令牌化在服务器端运行,防御者而不是攻击者决定模型接收到哪一个。我们利用这一点来衡量注入指令的权威有多少来自保留令牌的 learned 表示。将伪造的标记编码为子词,用固定的文本和控制额外令牌的数量来降低攻击的有效性。(论文赞 1)
在 Hugging Face 查看
排行第六:使用量化softmax在注意力中的Transformer预训练
低精度Transformer系统越来越多地对注意力矩阵乘法进行量化,而softmax通常仍保持较高精度。在预训练期间,近似softmax会改变训练模型的梯度以及其前向计算。我们研究了K间隔注意力(K-interval attention)与指数逼近的关系,该注意力使用K+1个网格值进行近似。我们 varying per-row grid calibration, interpolation versus hard rounding, and the placement of (论文赞 1)
在 Hugging Face 查看
排行第七:Chinese-Jev:将System One模型引入中文任务
本文提出Chinese-Jev,一个专为中文任务设计的System One模型。针对现有Jev模型在中文决策任务中准确率有限的问题,研究构建了统一的数据处理和训练流程。通过将异构中文标注转换为候选选项的概率目标,实现了跨领域和问题格式的共享训练框架。模型采用高效推理机制,旨在提升中文语言决策任务的性能。(论文赞 3)
在 Hugging Face 查看
排行第八:VoxMem:大型音频语言模型多模态记忆基准
本文介绍VoxMem基准,用于评估语音对话系统中的多模态记忆能力。研究指出,语音交互中的记忆信息不仅包括文本内容,还涉及说话人身份、语调和环境声音等仅存在于音频信号中的特征。基准涵盖单事实检索、多轮证据整合和跨会话状态跟踪等多样化记忆操作,弥补现有基准在维度覆盖上的不足。(论文赞 33)
在 Hugging Face 查看
排行第九:EpiCon:通过协同进化多模态记忆实现集体智能体学习
EpiCon框架支持智能体在不更新宿主模型参数的情况下进行集体经验学习。该框架通过两个独立训练的20亿参数模型(记忆控制器和树状自组织器)连接问题级记忆进化与持久经验库。控制器跨尝试联合优化文本指导和视觉证据,自组织器分层整合经验规则。在11个基准上的评估展示了其协同学习能力。(论文赞 3)
在 Hugging Face 查看
排行第十:EngiWorld:前沿智能体在专业工程环境中的表现
EngiWorld是首个围绕完整工程设计循环构建的基准,包含1,301个专家策划任务,覆盖CAD、CAE等6个工程领域和26个专业软件平台。基准包含GUI/CLI接口和从软件选择到开放式任务的6类任务类型,引入以工件为中心的评估方法,旨在测试智能体在几何物理约束下的跨软件推理能力。(论文赞 15)
在 Hugging Face 查看
排行第十一:边际零样本摊销序贯重要度采样二元矩阵
针对生态学、心理测量等领域中条件于行列和的二元矩阵分析问题,研究提出零样本摊销序贯重要度采样方法。该方法通过构建摊销提案分布替代传统解析设计,使每个样本权重等于精确计数倒数,实现高效空间均匀采样。解决了现有提案分布精度随边际变化不稳定的问题。(论文赞 1)
在 Hugging Face 查看
排行第十二:基于提示分歧的开放词汇语义分割偏好引导适配
针对开放词汇语义分割在医疗影像等专业领域性能下降的问题,提出用二元偏好替代密集掩码监督的适配框架。利用不同提示模板对同一图像产生系统性分割差异(提示分歧现象),将其转化为偏好信号指导模型适配。该方法降低了专业领域像素级标注的成本需求。
在 Hugging Face 查看
