文心一言解决幻觉能力最好 或成产业应用首选

来源: 上观新闻
2024-06-25 01:30:35

美人不戴胸罩露出奶头无遮挡「食べものがうまいっていいもんです。生きている証しのようなもんです」  李平康告诉《中国新闻周刊》,李铁去国家队后,他的教练组成员留在了武汉,李铁继续掌管球队。包括当时武汉队的外籍主帅何塞都没有实权,“甚至比赛时,场上换人都是李铁团队说了算”。8JYSm-FX9oryzIFPIKwA-文心一言解决幻觉能力最好 或成产业应用首选

  “林黛玉倒拔垂杨柳”、“月球上面有桂树”、“宋江字武松”……相信经常使用大语言模型都会遇到这样“一本正经胡说八道”的情况。这其实是大模型的“幻觉”问题,是大模型行业落地的核心挑战之一。例如幻觉会影响生成内容的可靠性,对于法律、金融、医疗等专业要求高的领域,将难以完成实际场景任务。因此,大模型幻觉问题也被认为是制 约大模型广泛应用的一大难题

  如何准确评估和解决大语言模型中的幻觉问题已经成为一个至关重要的挑战。近日,复旦大学与上海人工智能实验室构建了针对中文大模型的幻觉评测数据集HalluQA,对业界主流的大模型进行了评估。

  HalluQA采用无幻觉率来评估大模型的优劣。无幻觉率越高代表模型幻觉越低,事实准确性越高。在评测的24个主流大模型中,包括百度文心一言ERNIE-Bot、百川Baichuan、智谱ChatGLM、阿里通义千问和GPT-4等。

  中文大模型幻觉评测数据集HalluQA对24个主流大模型进行评测

  从评测结果来看,幻觉问题对大模型来说尚有困难,有18个模型的无幻觉率低于50%。在幻觉消除上,具备检索增强能力的大模型优势明显,在所有模型评测中,文心一言在整体幻觉问题解决方面表现突出,排名第一,整体无幻觉率为69.33%。而GPT-4整体无幻觉率为53.11%,排名第六。

  HalluQA:不同类型模型在不同类型的问题上的平均非幻觉率

  行业普遍认为,幻觉问题对于大模型在多个领域的落地都可能产生严重影响,包括客户服务、金融服务、法律决策和医疗诊断等。因此解决幻觉问题越好的大模型,才具备更强的产业落地价值。

责任编辑:张倩

  为防止医疗挤兑和减轻隔离压力,香港从2月初开始推行“居安抗疫”,允许轻症、无症状的阳性感染者居家隔离,并发布居家隔离指引,这也是新加坡、美国、德国等多数国家目前采取的分级措施:轻症居家、重症收治。

  徐雄俊进一步强调,从全球的营销情况来说,体育营销确实是效果比较好的,不管是奥运会还是世界杯,只要做就能取得一个较好的效果。

  奥密克戎病毒致病性减弱、疫苗接种普及、防控经验积累、群众的健康意识和素养明显提升……可以说,这是我国疫情防控面临新形势新任务的依据,同时,也为进一步优化完善防控措施创造了条件。

声明:该文观点仅代表作者本人,搜狐号系信息发布平台,搜狐仅提供信息存储空间服务。
用户反馈 合作

Copyright © 2023 Sohu All Rights Reserved

搜狐公司 版权所有