-
- 2026/9/29
- 默认分类
本周顶级AI论文精选(9月21日至27日):- HySparse2 - EvoOntology - Harness-Zero - JEV-as-a-Judge - 维基基金会模型 - 自组织代理团队 - 通过快速树搜索实现自我提升。更多精彩- 2阅读
- 0评论
-
- 2026/9/28
- 默认分类
RT 关于个人代理出了问题的帖子。随着我们越来越多地使用个人代理来执行个性化任务,一些有趣的动态和行为将会出现。我认为,现在的个人代理仍然需要谨慎地引导和调整,以符合我们的期望。在这篇有趣的新研究中,一个个人代理读了用户关于68万美元的40- 3阅读
- 0评论
-
- 2026/9/28
- 默认分类
行了,艾尔维·黄仁勋,这是个工程问题!这个话题政治化太严重了,咱们回归本质吧。“信任与创新不冲突,安全是赢得信任的方式。” 今天英伟达和超100家行业伙伴推出了开放代理安全平台,把OpenShell和Sentry整合在一起。AI是划时代的技- 4阅读
- 0评论
-
- 2026/9/28
- 默认分类
RT 艾尔维斯,我刚刚用一个开源堆栈运行了一个论文研究代理,大约10秒后,本周排名前五的关于代理记忆的论文就出现在了我的终端上。它是怎么工作的呢?我使用Tavily抓取了过去7天的arXiv论文,然后由NVIDIA Nemotron 3 U- 4阅读
- 0评论
-
- 2026/9/28
- 默认分类
一个有趣的想法是持续训练针对特定技能的专用模型。这篇论文就探讨了这个思路。他们提出了SkillGym系统,将人工编写的技能转化为2,756个代码检测训练场景,并用8,364条成功轨迹进行微调。微调后,在Claude Code中运行的Qwen- 3阅读
- 0评论
-
- 2026/9/28
- 默认分类
转发自Elvis,一篇关于用Jev检测模型对齐失败的有趣论文。核心方法是让Jev对模型回复提一个通用的“是/否”问题,用它的置信度作为评分。无需额外训练,这个评分就能很好地区分失败和正常回复,中位数AUROC达到0.886。而且成本超低!1- 3阅读
- 0评论
-
- 2026/9/28
- 默认分类
转发@elvis 这篇太棒了,必读!它完美展示了如何用系统一和系统二模型打造更高效的工具。作者把杰夫开发模糊校验器的潜力挖掘得很到位。别急着否定,先看看他们的设置。我喜欢这篇帖子,因为它详细介绍了测试这些想法的好方法——比如先过滤掉容易判断- 3阅读
- 0评论
-
- 2026/9/28
- 默认分类
看到分类模型在智能体时代重新崛起真的很酷。Jev模型的效果简直惊人!更让我兴奋的是,我们@dair_ai团队构建的情感数据集被用来测试这个新模型Julia-1。我整个博士期间都在从头构建高效分类器(从图算法到深度学习),如今看到这个趋势回归- 3阅读
- 0评论
-
- 2026/9/28
- 默认分类
转发Elvis,我同意!大家一定要学基础!要是想靠智能体扎实做开发,这一点超重要,绕都绕不开。我最近开始深入研究评估、基础设施、架构、搜索扩展,还有用@dair_ai做的智能体沙盒这类东西,发现太容易产出垃圾内容了——哪怕用现在最先进的模型- 3阅读
- 0评论
-
- 2026/9/28
- 默认分类
转推:Elvis 这是我见过的System One模型(比如Jev)最有力的应用场景之一。如果你在做自定义的推理框架,一定要仔细看看。现在Jev已经作为打包好的路由器提供使用了。它是什么?你只需把对话发送到typesafe/jev-rout- 3阅读
- 0评论
1 2