-
- 2026/9/28
- 默认分类
【转推Arcee.ai】我们很荣幸赞助由@huggingface 于10月16日(周五)在旧金山举办的免费社区活动"Open Together",为开源AI周拉开序幕。当晚活动分为两部分: ➡️ 晚6点-9点:36场社区项目实时演示+美食饮- 5阅读
- 0评论
-
- 2026/9/28
- 默认分类
一个有趣的想法是持续训练针对特定技能的专用模型。这篇论文就探讨了这个思路。他们提出了SkillGym系统,将人工编写的技能转化为2,756个代码检测训练场景,并用8,364条成功轨迹进行微调。微调后,在Claude Code中运行的Qwen- 7阅读
- 0评论
-
- 2026/9/28
- 默认分类
转发自Elvis,一篇关于用Jev检测模型对齐失败的有趣论文。核心方法是让Jev对模型回复提一个通用的“是/否”问题,用它的置信度作为评分。无需额外训练,这个评分就能很好地区分失败和正常回复,中位数AUROC达到0.886。而且成本超低!1- 5阅读
- 0评论
-
- 2026/9/28
- 默认分类
转发@elvis 这篇太棒了,必读!它完美展示了如何用系统一和系统二模型打造更高效的工具。作者把杰夫开发模糊校验器的潜力挖掘得很到位。别急着否定,先看看他们的设置。我喜欢这篇帖子,因为它详细介绍了测试这些想法的好方法——比如先过滤掉容易判断- 5阅读
- 0评论
-
- 2026/9/28
- 默认分类
看到分类模型在智能体时代重新崛起真的很酷。Jev模型的效果简直惊人!更让我兴奋的是,我们@dair_ai团队构建的情感数据集被用来测试这个新模型Julia-1。我整个博士期间都在从头构建高效分类器(从图算法到深度学习),如今看到这个趋势回归- 6阅读
- 0评论
-
- 2026/9/28
- 默认分类
转发Elvis,我同意!大家一定要学基础!要是想靠智能体扎实做开发,这一点超重要,绕都绕不开。我最近开始深入研究评估、基础设施、架构、搜索扩展,还有用@dair_ai做的智能体沙盒这类东西,发现太容易产出垃圾内容了——哪怕用现在最先进的模型- 5阅读
- 0评论
-
- 2026/9/28
- 默认分类
转推:Elvis 这是我见过的System One模型(比如Jev)最有力的应用场景之一。如果你在做自定义的推理框架,一定要仔细看看。现在Jev已经作为打包好的路由器提供使用了。它是什么?你只需把对话发送到typesafe/jev-rout- 5阅读
- 0评论
-
- 2026/9/28
- 默认分类
大多数个人代理如今都经过高度优化,旨在促使我们消费更多(例如,在线购物、预订机票、规划假期等)。我明白每个构建这些代理的公司都有自己的动机。消费代理确实有用,这点我完全认同。不过,我也希望看到更多以人为本的代理,能够解锁真正的机会,比如创业- 5阅读
- 0评论
-
- 2026/9/28
- 默认分类
转自DAIR.AI:Salesforce AI Research关于智能体记忆的论文太炸了。核心结论是:应该存储原始任务轨迹,等新任务到来时再决定从中提取什么,而不是每次任务结束时立刻做总结。这套"即时记忆"系统通过一个调度模块,将检索到的- 5阅读
- 0评论
-
- 2026/9/28
- 默认分类
Salesforce AI研究团队发布了一篇关于代理记忆的精彩论文。主要发现是,应该存储原始轨迹,在下一个任务到来时决定从中提取什么信息,而不是在每次任务结束时进行总结。即时记忆使用一个策展人,它会读取检索到的轨迹和新任务,然后为该任务编写- 6阅读
- 0评论