老思路遇上新问题:基于大语言模型的新颖性评估论文的不稳定性 这篇论文探讨了用大语言模型来评估新颖性的方法存在的问题。作者发现,虽然这些模型在很多任务上表现优秀,但在评估创造性内容的新颖性时却不够稳定可靠。这就像用一个会"撒谎"的测谎仪来检测真相一样,结果往往让人难以信服。研究者们呼吁需要更严谨的评估标准和方法。
—— AK (@_akhaliq) X帖子|2026-10-08T22:52:27+00:00
原帖:https://x.com/_akhaliq/status/2108329708345758115
AK:老思路遇上新问题:基于大语言模型的新颖性评估论文的不稳定性 …
老思路遇上新问题:基于大语言模型的新颖性评估论文的不稳定性 这篇论文探讨了用大语言模型来评估新颖性的方法存在的问题。作者发现,虽然这些模型在很多任务上表现优秀,但在评估创造性内容的新颖性时却不够稳定可靠。这就像用一个会"撒谎"的测谎仪来检测
扫描二维码,在手机上阅读
