成人免费xxxxx在线视频软件_久久精品久久久_亚洲国产精品久久久_天天色天天色_亚洲人成一区_欧美一级欧美三级在线观看

可協(xié)助 AI 語(yǔ)言模型改善自我糾錯(cuò)能力,谷歌推出 BIG-Bench Mistake 數(shù)據(jù)集

人工智能
據(jù)悉,研究人員首先使用 PaLM 語(yǔ)言模型在自家 BIG-Bench 基準(zhǔn)測(cè)試任務(wù)中運(yùn)行了 5 項(xiàng)任務(wù),之后將生成的“思維鏈(Chain-of-Thought)”軌跡修改加入“邏輯錯(cuò)誤”部分,之后重新丟給模型判斷思維鏈軌跡中哪些地方存在錯(cuò)誤。

IT之家 1 月 15 日消息,谷歌研究院日前使用自家 BIG-Bench 基準(zhǔn)測(cè)試建立了一項(xiàng)“BIG-Bench Mistake”數(shù)據(jù)集,并利用相關(guān)數(shù)據(jù)集對(duì)市面上流行的語(yǔ)言模型“出錯(cuò)概率”及“糾錯(cuò)能力”進(jìn)行了一系列評(píng)估研究。

谷歌研究人員表示,由于過去沒有能夠評(píng)估大語(yǔ)言模型“出錯(cuò)概率”及“自我糾錯(cuò)能力”的數(shù)據(jù)集,因此他們創(chuàng)建了一項(xiàng)名為“BIG-Bench Mistake”的專用基準(zhǔn)數(shù)據(jù)集用于評(píng)估測(cè)試。

據(jù)悉,研究人員首先使用 PaLM 語(yǔ)言模型在自家 BIG-Bench 基準(zhǔn)測(cè)試任務(wù)中運(yùn)行了 5 項(xiàng)任務(wù),之后將生成的“思維鏈(Chain-of-Thought)”軌跡修改加入“邏輯錯(cuò)誤”部分,之后重新丟給模型判斷思維鏈軌跡中哪些地方存在錯(cuò)誤。

為了提升數(shù)據(jù)集準(zhǔn)確程度,谷歌研究人員反復(fù)進(jìn)行上述過程,最終形成了一項(xiàng)內(nèi)含“255 項(xiàng)邏輯錯(cuò)誤”的“BIG-Bench Mistake”專用基準(zhǔn)數(shù)據(jù)集。

研究人員提到,由于“BIG-Bench Mistake”數(shù)據(jù)集中的邏輯錯(cuò)誤較為“簡(jiǎn)單明確”,因此可以作為一個(gè)良好的測(cè)試標(biāo)準(zhǔn),可協(xié)助語(yǔ)言模型先從簡(jiǎn)單的邏輯錯(cuò)誤開始練習(xí),逐步提升辨識(shí)錯(cuò)誤的能力。

研究人員利用該數(shù)據(jù)集對(duì)市面上模型進(jìn)行測(cè)試,發(fā)現(xiàn)雖然絕大多數(shù)語(yǔ)言模型可以識(shí)別在推理過程中出現(xiàn)的邏輯錯(cuò)誤并進(jìn)行自我修正,但這個(gè)過程“并不夠理想”,通常需要人工干預(yù)來糾正模型輸出的內(nèi)容。

▲ 圖源 谷歌研究院新聞稿

IT之家從報(bào)告中發(fā)現(xiàn),谷歌聲稱“目前最先進(jìn)的大語(yǔ)言模型”自我糾錯(cuò)能力也相對(duì)有限,在相關(guān)測(cè)試結(jié)果中成績(jī)發(fā)揮最好的模型,也僅僅找出了 52.9% 的邏輯錯(cuò)誤

谷歌研究人員同時(shí)聲稱,這一 BIG-Bench Mistake 數(shù)據(jù)集有利于改善模型自我糾錯(cuò)能力,經(jīng)過相關(guān)測(cè)試任務(wù)微調(diào)后的模型,“即便是小型模型表現(xiàn)也通常比零樣本提示的大模型更好”。

據(jù)此,谷歌認(rèn)為在模型糾錯(cuò)方面,可以使用專有小型模型“監(jiān)督”大型模型,相對(duì)于讓大語(yǔ)言模型學(xué)會(huì)“糾正自我錯(cuò)誤”,部署專用于監(jiān)督大模型的小型專用模型有利于改善效率、降低相關(guān) AI 部署成本,并更便于微調(diào)

責(zé)任編輯:姜華 來源: 漾仔
相關(guān)推薦

2022-06-13 10:43:11

谷歌模型學(xué)者

2025-03-03 07:30:00

谷歌模型AI

2024-12-17 12:53:45

AI自我進(jìn)化谷歌

2023-11-07 14:07:51

GPT-4大語(yǔ)言模型

2021-05-31 14:57:13

谷歌AI工具人工智能

2024-01-23 11:22:53

谷歌大語(yǔ)言模型AI

2023-12-07 11:12:54

大型語(yǔ)言模型Gemini人工智能

2016-02-25 10:07:03

谷歌硬盤數(shù)據(jù)中心

2023-11-21 14:48:11

2023-11-15 14:17:23

微軟語(yǔ)言模型AI 模型

2025-01-26 13:20:49

谷歌AI模型Titans

2023-07-05 15:02:51

2023-05-22 09:19:19

2025-04-09 11:01:19

2024-12-12 09:00:33

2011-09-09 12:09:27

Dart

2025-05-12 14:29:16

絕對(duì)零外部數(shù)據(jù)訓(xùn)練法

2025-05-06 09:13:15

2023-07-31 16:19:47

機(jī)器人人工智能

2023-02-28 14:57:02

MetaAI
點(diǎn)贊
收藏

51CTO技術(shù)棧公眾號(hào)

主站蜘蛛池模板: 亚洲精品久久久一区二区三区 | 日韩中文一区二区三区 | 欧美久久国产 | 超碰导航 | 亚洲香蕉在线视频 | 国产精品久久久久久久久久久免费看 | av片免费| 自拍偷拍亚洲一区 | 亚洲黄色网址视频 | 青青久在线视频 | 亚洲国产成人精品女人久久久 | 高清av一区 | 男女激情网 | 久久久精品一区 | 在线亚洲一区 | 免费黄网站在线观看 | 91 中文字幕 | 日本天天操 | 成人网av | av片在线观看网站 | 99re6在线视频精品免费 | 国产在线播放一区二区三区 | 天天操天天天干 | 国产精品污污视频 | 日日摸夜夜添夜夜添特色大片 | 精品国产欧美一区二区 | 一区观看 | 中国一级特黄毛片大片 | 久久9热 | 成人免费三级电影 | 久久久久久久久久久91 | 久久久国产一区 | 在线观看中文字幕 | 欧美日韩一区二区在线观看 | 欧美精品乱码久久久久久按摩 | 亚洲一区二区免费看 | 免费视频二区 | 岛国av一区二区三区 | 国产精品一区二区视频 | 亚洲综合久久网 | 91在线看视频 |