研究人员发布了IndicBankBench基准,包含799个案例,用于评估印度零售银行业务中语言模型助手的安全性和可靠性。该基准涵盖五个运营领域,旨在检测助手在处理账户特定信息时的错误,如重复询问已有信息、依赖过时上下文、选择错误账户或提供无效值。这一工具将帮助开发者识别和改进模型在银行业务中的表现,提升用户体验和系统安全性。
推荐理由:为印度零售银行业务提供首个大规模评估基准,填补了语言模型在特定行业应用中的评测空白。
来源:arXiv cs.AI|原文时间:2026-09-25
原文链接:https://arxiv.org/abs/2609.29167
原题:IndicBankBench: Evaluating Safety and Reliability of Language Model Assistants in Indian Retail Banking
IndicBankBench:评估印度零售银行业务中语言模型助手的安全性和可靠性
研究人员发布了IndicBankBench基准,包含799个案例,用于评估印度零售银行业务中语言模型助手的安全性和可靠性。该基准涵盖五个运营领域,旨在检测助手在处理账户特定信息时的错误,如重复询问已有信息、依赖过时上下文、选择错误账户或提供无效值。这一工具将帮助开发者识别和改进模型在银行业务中的表现
扫描二维码,在手机上阅读
