RT @aipulsedaily 金星4号氩气在人工分析中的幻觉率超低,只有15%。格罗克4.7是29%,GPT-6 星际45%,奥普斯5.5是59%,费尔比5.1更是高达69%。只有那些低于它的模型几乎不回答问题,而且它们答对的也不超过15%。它在最大模式下的正确率甚至比奥普斯5.5还低,只有50%,而奥普斯5.5是66%。不过,它不知道的时候会坦白说不知道,而不是瞎编。真想早点拿到它。
—— Demis Hassabis (@demishassabis) X帖子|2026-09-30T20:28:11+00:00
原帖:https://x.com/demishassabis/status/2105462258465948009
Demis Hassabis:RT @aipulsedaily 金星4号氩气在人工分析中的…
RT @aipulsedaily 金星4号氩气在人工分析中的幻觉率超低,只有15%。格罗克4.7是29%,GPT-6 星际45%,奥普斯5.5是59%,费尔比5.1更是高达69%。只有那些低于它的模型几乎不回答问题,而且它们答对的也不超过1
扫描二维码,在手机上阅读
