发现者网
产业经济 科技业界 3C数码 文化传媒 移动智能 家电行业 产业互联网 AI大模型 汽车出行

OpenAI推出SimpleQA新基准:治理大模型“信口开河”有招了?

2024-10-31来源:ITBEAR编辑:瑞雪

OpenAI于近日推出了一项名为SimpleQA的新基准,旨在评估语言模型在回答简短事实寻求问题时的准确性。这一举措是AI领域追求更高事实正确性的重要一步。

据悉,SimpleQA通过一系列严格的标准来确保评估的公正性和有效性。其中包括高正确性,即参考答案需经两名独立AI训练师验证;多样性,涵盖从科学技术到娱乐等多个主题;以及前沿挑战性,相比早期的基准,SimpleQA更能测试出前沿模型的实力。

SimpleQA还注重高效用户体验,问题与答案设计得简洁明了,便于快速操作和评分。通过OpenAI API等工具,用户可以轻松地进行模型评估。

OpenAI表示,尽管SimpleQA在短查询的受限设置中测量事实准确性,但其希望这一基准的开源能够推动AI研究在更广泛领域的应用和发展。同时,SimpleQA也揭示了当前语言模型在生成事实正确回答方面仍面临的挑战,即如何减少错误输出和未经证实的答案,这一问题也被称为“幻觉”。

通过SimpleQA的推出,OpenAI期望能够进一步促进语言模型的优化和完善,使其在更多场景中发挥出更大的价值。

Meta Platforms三季度营收405.9亿美元,分析师预期402.5亿美元。三季度广告收入398.9亿美元,预期397
1亿美元。预计四季度营收450-480亿美元,分析师预期460.9亿美元。Meta美股盘后跌3.68%。…

2024-10-31

网红券商Robinhood三季度业绩全面逊于预期,股价盘后跌约13%
Robinhood三季度EPS为0.17美元,分析师预期0.18美元。三季度净营收6.37亿美元,分析师预期6.635亿美元。三季度月活用户数1100万,分析师预期1226万。三季度基于交易的收入3.19亿美…

2024-10-31

着眼“赚未来的钱”,银行披露互换便利业务进度条
证券、基金、保险公司互换便利(SFISF)创新金融工具推出后,商业银行积极响应,火速布局。多家国有行与股份行已宣布落地SFISF工具下质押国债或央行票据的债券回购交易,为非银机构提供金融市场综合服务方案。业内…

2024-10-31

主板A股市值退市新标准昨起实施,突出价值投资关键点
10月30日起,沪深主板A股公司市值退市标准正式调整为5亿元。当前各方在加大退市力度上已经形成共识,对指标设置也比较关注。本次退市规则指标设置,落实加大退市监管力度,突出上市公司投资价值,同时也综合考虑了市场…

2024-10-31