Google 計劃支持世界上 1000種最常用語言的巨型 AI 語言模組

Google 計劃支持世界上 1000種最常用語言的巨型 AI 語言模組

| 這是一個處於早期階段的雄心勃勃的項目,但 Google 認為它將在其整個產品生態系統中受益。

Google 宣布了一項雄心勃勃的新項目,旨在開發一種支持世界上 “1000 種最常用語言” 的單一人工智能語言模組。作為實現這一目標的第一步,該公司正在推出一種經過 400多種語言訓練的 AI 模組,它被描述為 “當今語音模組中最大的語言覆蓋率”。

可以說語言和人工智能一直是 Google 產品的核心,但機器學習的最新進展——特別是強大的多功能 “大型語言模組” 或 LLM 的開發——重新強調了這些領域。

Google 已經開始將這些語言模組集成到 Google 搜索等產品中,同時抵制對系統功能的批評。語言模組有許多缺陷,包括傾向於反芻有害的社會偏見,如種族主義和仇外心理,以及無法以人類敏感性解析語言。Google 在發表了概述這些問題的論文後,臭名昭著地解雇了自己的研究人員。

但是這些模組能夠完成許多任務,從語言生成 (如 OpenAI 的 GPT-3) 到翻譯 (參閱 Meta 的 No Language Left Behind工作)。Google 的 “1,000 種語言計劃” 並不專注於任何特定的功能,而是專注於創建一個具有全球語言知識廣度的單一系統。

Google AI 研究副總裁 Zoubin Ghahramani 在接受 The Verge 採訪時表示,該公司認為,創建這種規模的模型將更容易將各種 AI 功能引入在線空間和 AI 訓練數據集中表現不佳的語言 (也稱為 “低資源語言”)。

語言就像有機體,它們是相互進化而來的,並且具有某些相似之處。
Ghahramani 說:”通過擁有一個暴露於多種不同語言並對其進行訓練的單一模型,我們在資源匱乏的語言上獲得了更好的性能”。  “我們獲得 1000種語言的方法不是建立 1000種不同的模型。語言就像有機體,它們是相互進化而來的,並且具有一定的相似性。當我們將來自一種新語言的數據整合到我們的 1,000 種語言模型中並獲得將 [它學到的] 從高資源語言翻譯成低資源語言的能力時,我們可以在我們所謂的零樣本學習中發現一些相當驚人的進步。資源語言”。

過去的研究表明了這種方法的有效性,Google 計劃模組的規模可能會比過去的工作帶來實質性的收益。此類大型項目已成為科技公司主導人工智能研究的雄心的典型代表,並利用這些公司在獲得大量計算能力和訓練數據方面的獨特優勢。一個類似的項目是 Facebook 母公司 Meta 正在進行的構建 “通用語音翻譯器” 的嘗試。

但是在跨多種語言進行培訓時,訪問數據是一個問題,Google 表示,為了支持 1000種語言模組的工作,它將資助低資源語言的數據收集,包括錄音和書面文本.

該公司表示,它沒有直接計劃在哪裡應用這種模型的功能——只是它預計它將在 Google 的產品中得到廣泛的使用,從 Google 翻譯到 YouTube 字幕等等。

“相同的語言模組可以將機器人的命令轉化為代碼;它可以解決數學問題;它可以做翻譯”。
“總括來說,大型語言模組和語言研究的一個真正有趣的事情是它們可以完成很多不同的任務,”Ghahramani 說”。相同的語言模型可以將機器人的命令轉化為代碼;它可以解決數學問題;它可以做翻譯。語言模型真正有趣的地方在於它們正在成為大量知識的存儲庫,通過以不同的方式探索它們,您可以獲得不同的有用功能。”

谷歌在新的人工智能產品展示會上宣布了 1000 種語言的模型。該公司還分享了關於文本到視頻模型的新研究、一個名為 Wordcraft 的原型 AI 寫作助手,以及其 AI Test Kitchen 應用程序的更新,該應用程序允許用戶有限地訪問開發中的 AI 模型,例如其文本到圖像模型圖像。

原文轉自

記得 LIKE 我地 facebook Sharefollow IG 同支持最潮及最新資訊既 《飛聞CHILL流誌》 ????