首頁(yè)|必讀|視頻|專訪|運(yùn)營(yíng)|制造|監(jiān)管|大數(shù)據(jù)|物聯(lián)網(wǎng)|量子|元宇宙|博客|特約記者
手機(jī)|互聯(lián)網(wǎng)|IT|5G|光通信|人工智能|云計(jì)算|芯片|報(bào)告|智慧城市|移動(dòng)互聯(lián)網(wǎng)|會(huì)展
首頁(yè) >> 人工智能 >> 正文

OpenAI開源SimpleQA新基準(zhǔn),專治大模型“胡言亂語(yǔ)”

2024年10月31日 10:37  IT之家  作 者:清源

當(dāng)?shù)貢r(shí)間 30 日,OpenAI 宣布,為了衡量語(yǔ)言模型的準(zhǔn)確性,將開源一個(gè)名為 SimpleQA 的新基準(zhǔn),可衡量語(yǔ)言模型回答簡(jiǎn)短的事實(shí)尋求(fact-seeking)問(wèn)題的能力。

AI 領(lǐng)域中的一個(gè)開放性難題是如何訓(xùn)練模型生成事實(shí)正確的回答。當(dāng)前的語(yǔ)言模型有時(shí)會(huì)產(chǎn)生錯(cuò)誤輸出或未經(jīng)證實(shí)的答案,這一問(wèn)題被稱為“幻覺(jué)”。能夠生成更準(zhǔn)確、更少幻覺(jué)的回答的語(yǔ)言模型更為可靠,可以用于更廣泛的應(yīng)用領(lǐng)域。

OpenAI 表示,目標(biāo)是使用 SimpleQA 創(chuàng)建一個(gè)具備以下特點(diǎn)的數(shù)據(jù)集:

高正確性:問(wèn)題的參考答案由兩名獨(dú)立的 AI 訓(xùn)練師驗(yàn)證,以確保評(píng)分的公正性。

多樣性:SimpleQA 涵蓋廣泛主題,從科學(xué)技術(shù)到電視節(jié)目與電子游戲應(yīng)有盡有。

前沿挑戰(zhàn)性:與 TriviaQA(2017 年)或 NQ(2019 年)等早期基準(zhǔn)相比,SimpleQA 更具挑戰(zhàn)性,尤其針對(duì)如 GPT-4o 等前沿模型(例如,GPT-4o 的得分不足 40%)。

高效用戶體驗(yàn):SimpleQA 問(wèn)題與答案簡(jiǎn)潔明了,使操作快速高效,并可通過(guò) OpenAI API 等進(jìn)行快速評(píng)分。此外,包含 4326 道問(wèn)題的 SimpleQA 在評(píng)估中應(yīng)具有較低的方差。

SimpleQA 將是一個(gè)簡(jiǎn)單但具有挑戰(zhàn)性的基準(zhǔn),用于評(píng)估前沿模型的事實(shí)準(zhǔn)確性。SimpleQA 的主要限制在于其范圍 —— 盡管 SimpleQA 準(zhǔn)確,但它只在短查詢的受限設(shè)置中測(cè)量事實(shí)準(zhǔn)確性,這些查詢是事實(shí)導(dǎo)向的,并且有一個(gè)可驗(yàn)證的答案。

OpenAI 表示,模型在短回答中表現(xiàn)出的事實(shí)性是否與其在長(zhǎng)篇、多事實(shí)內(nèi)容中的表現(xiàn)相關(guān),這仍是個(gè)懸而未決的研究課題。其希望 SimpleQA 的開源能夠進(jìn)一步推動(dòng) AI 研究的發(fā)展,使模型更加可信并富有可靠性。

編 輯:章芳
飛象網(wǎng)版權(quán)及免責(zé)聲明:
1.本網(wǎng)刊載內(nèi)容,凡注明來(lái)源為“飛象網(wǎng)”和“飛象原創(chuàng)”皆屬飛象網(wǎng)版權(quán)所有,未經(jīng)允許禁止轉(zhuǎn)載、摘編及鏡像,違者必究。對(duì)于經(jīng)過(guò)授權(quán)可以轉(zhuǎn)載,請(qǐng)必須保持轉(zhuǎn)載文章、圖像、音視頻的完整性,并完整標(biāo)注作者信息和飛象網(wǎng)來(lái)源。
2.凡注明“來(lái)源:XXXX”的作品,均轉(zhuǎn)載自其它媒體,在于傳播更多行業(yè)信息,并不代表本網(wǎng)贊同其觀點(diǎn)和對(duì)其真實(shí)性負(fù)責(zé)。
3.如因作品內(nèi)容、版權(quán)和其它問(wèn)題,請(qǐng)?jiān)谙嚓P(guān)作品刊發(fā)之日起30日內(nèi)與本網(wǎng)聯(lián)系,我們將第一時(shí)間予以處理。
本站聯(lián)系電話為86-010-87765777,郵件后綴為cctime.com,冒充本站員工以任何其他聯(lián)系方式,進(jìn)行的“內(nèi)容核實(shí)”、“商務(wù)聯(lián)系”等行為,均不能代表本站。本站擁有對(duì)此聲明的最終解釋權(quán)。
相關(guān)新聞              
 
人物
中國(guó)電信李峻:只有當(dāng)人工智能成為公共基礎(chǔ)設(shè)施,才能普惠大眾
精彩專題
2024中國(guó)算力大會(huì)
2024年國(guó)際信息通信展
中國(guó)信科亮相2024年國(guó)際信息通信展
第25屆中國(guó)國(guó)際光電博覽會(huì)
CCTIME推薦
關(guān)于我們 | 廣告報(bào)價(jià) | 聯(lián)系我們 | 隱私聲明 | 本站地圖
CCTIME飛象網(wǎng) CopyRight © 2007-2024 By CCTIME.COM
京ICP備08004280號(hào)-1  電信與信息服務(wù)業(yè)務(wù)經(jīng)營(yíng)許可證080234號(hào) 京公網(wǎng)安備110105000771號(hào)
公司名稱: 北京飛象互動(dòng)文化傳媒有限公司
未經(jīng)書面許可,禁止轉(zhuǎn)載、摘編、復(fù)制、鏡像