DoNews8月7日消息,近日,清华大学新闻与传播学院沈阳团队发布《大语言模型综合性能评估报告》(下文简称“报告”),报告显示百度文心一言在三大维度20项指标中综合评分国内第一,超越ChatGPT,其中中文语义理解排名第一,部分中文能力超越GPT-4。
清华大学新闻与传播学院教授、博士生导师沈阳表示:“今年3月,百度在全球大型科技公司中率先发布了大语言模型文心一言,让中国第一时间参与到世界前沿科技竞争中。我们在这次评测中也看到了文心一言各方面能力的进步,特别是在中文语义理解方面,表现惊艳。国产大模型的快速发展,让技术落地更可期。”
据了解,报告本次评估选取了GPT-4、ChatGPT 3.5、文心一言、通义千问、讯飞星火、Claude、天工7个大语言模型,围绕生成质量、使用与性能、安全与合规三大维度,全面考察大语言模型上下文理解、中文语义理解、误导信息识别、逻辑推理、内容安全性、隐私保护等20项指标。
(资料图片)
综合来看,文心一言语义理解能力突出,特别是具备更好的中文理解能力,更懂中国文化,同时时效性强、内容安全把握细微,这源于其知识增强、检索增强和对话增强的技术创新。
在生成质量方面,基于对语义理解、输出表达、适应泛化的综合评测,文心一言得分率76.98%,仅次于GPT-4,遥遥领先于包括ChatGPT在内的其他大语言模型。
其中,在部分中文语义理解方面,文心一言以92%的得分率排名榜首,超越讯飞星火、GPT-4。凭借知识增强的核心特色,文心一言对本土语言特性把握更精准,同时由于训练语料中包含大量本土文本,对本土文化理解也更深刻,能够更好处理与本土文化相关的主题和背景,如诗歌、方言等,具备更强的国内落地空间。
在安全合规方面,基于对内容安全性、偏见和公平性、隐私保护等综合评测,文心一言得分率78.18%,与GPT-4并列排名第一,远超其他大语言模型。报告显示,文心一言内容安全性好,注重用户隐私保护和版权保护。
据了解,百度在“芯片-框架-模型-应用”人工智能四层技术栈全面布局,其自研深度学习平台飞桨有力支撑了文心大模型的高效训练和推理,截至目前飞桨已凝聚750万名开发者。
飞桨与文心协同优化,文心大模型3.5最新版本实现了基础模型升级、精调技术创新、知识点增强、逻辑推理增强等,模型效果提升50%,训练速度提升2倍,推理速度提升30倍。
当下,推进行业大模型应用落地成为大势所趋。百度文心大模型此前已联合国家电网、浦发银行、泰康、吉利等企业单位,合作发布了11个行业大模型。目前文心大模型拥有中国最大的产业应用规模,15万家企业申请接入文心一言测试,在超过400个场景中已取得相当不错的测试效果。
本文源自:iDoNews
关键词:
清华最新报告评估,文心大模型3.5部分中文能力超越GPT-4
涉案金额约2000万!福州破获珍贵品种鹦鹉蛋走私案
健身时间“碎片化”、健身方式“个性化”......西安中青年健身锻炼有这些特点
河南镇平:小针织“织”出乡村振兴致富路
7月份中国电商物流指数继续上涨
成都温江人才公寓有产权吗?
2023吉林高温补贴发放时间及发放标准(附原文)
心疼浓眉!多位球星声援!难怪利拉德要走!
午评:沪指弱势震荡跌0.56%,地产、医药等板块走低,传媒板块逆市活跃
华侨城集团20亿元中期票据拟付息 利率3.98%
【文化评析】沉浸式感受传统文化之“热”
北京受灾情影响较大职工可全额提取公积金
北京语言大学2023年福建(历史类)本科一批录取分数线
阜新市博物馆将举办暑期科普研学活动
挖金客8月7日快速反弹
常山北明:8月4日融资买入3393.9万元,融资融券余额5.66亿元
小Q书桌_关于小Q书桌介绍
利通科技:8月4日获融资偿还37.28万元
看了这份捐赠物资明细表我懵了:买1920件套装西服送灾区不能理解
华菱(华菱汽车图片)(1)
穿越前世之血族新娘(寻找前世之旅之血族新娘全文阅读)
南华工业(南华工业大学)
【转会中心】内马尔将回归巴萨?丨国米签萨马尔季奇HWG
江苏退休工资高不高?2023江苏企业退休人员的工资上涨多少附调整方案
穿越小说女主强大腹黑清冷(穿越文女主聪明淡然腹黑强大)
热血漫爱好者的福音
西南药业股票(西南药业股票怎么样)
卡罗拉锐放双擎上市 13.98-18.48万元
留置人员是犯罪人员吗
乌媒曝图:基辅“祖国母亲”雕像上的苏联国徽已更换为三叉戟
19岁姑娘被查出这种病!此病死亡率高 ,即使手术很成功,依旧需要长期吃药
双塔阵容还是双锋线?中国男篮的选择与挑战!
中国红十字会:截至5日22时,14支红十字救援队在涿州灾区共转移1475名受灾群众
迎接挑战 青春绽放(大运观澜)
市场监管总局发布汛期维护市场价格秩序“七不得”公告
彪马板鞋值得买吗(彪马板鞋的优点和缺点)
相关新闻