亚洲欧美自拍一区_91精品国产高清一区二区三区 _日韩欧美资源站_日韩成人在线视频观看

首頁 > 觀察 >

AI能接管實驗室了?中國科大最新研究給出真實物理世界的壓力測試

2026-07-31 21:29:17 新智元

新智元報道

我們如何判斷人工智能是否已經足夠聰明,能夠從事科學研究,實現(xiàn)端到端的自主科學發(fā)現(xiàn)?


(資料圖片)

中國科學技術大學發(fā)布的最新研究讓AI「大腦」接管機器科學家實驗室「身體」,由此將這一問題從知識問答和方案生成,推進到真實物理世界中的實驗執(zhí)行與反饋學習。

論文鏈接:https://arxiv.org/abs/2607.23045

研究團隊搭建了一個機器催化實驗室,其中包括45個覆蓋合成、表征和催化性能測試的模塊化自動工作站。

為了讓AI理解和調用實驗室能力,研究團隊將這些能力封裝為機器可讀技能(skills)。AI智能體可以通過這些技能直接調用實驗設備,同時接受真實設備能力、操作規(guī)范和實驗條件的約束。

圖1.用于催化研究的AI讀得懂的機器科學家實驗室架構。

圖2.從科學意圖到機器實驗室執(zhí)行路徑。

壓力測試

基于該平臺,研究團隊對由6種智能體框架和9種大語言模型構成的48種實際配置進行了系統(tǒng)評測。

測試覆蓋32項由領域專家定義的研究任務,共計4,608次評測試次。評估不僅考察智能體能否生成實驗計劃,還追蹤這些計劃能否通過核驗并下發(fā)至機器人系統(tǒng),以及生成的工作流是否能夠在無需人工干預的情況下直接執(zhí)行。

殘酷的真實世界評測結果

當前領先的大語言模型智能體距離「接管」仍有明顯差距。在4,608次測試中,僅151個工作流無需人工修復即可執(zhí)行,占全部測試的3.3%。表現(xiàn)最好的Claude Code與Claude Opus 4.7組合,可執(zhí)行率為28.1%;Codex與GPT 5.5組合的可執(zhí)行率為19.8%。

會調整參數(shù),不等于會重新規(guī)劃

研究還進一步考察了智能體能否從真實實驗結果中學習。團隊將Codex/GPT 5.5的組合置于一個開放式的五輪閉環(huán)中,連續(xù)開展實驗規(guī)劃、機器人執(zhí)行、證據(jù)獲取和重新規(guī)劃。

智能體能夠根據(jù)返回的實驗結果調整材料配方和操作條件,但這些調整主要停留在局部參數(shù)優(yōu)化層面。

在五輪實驗過程中,智能體始終保留原有的工作流骨架,沒有重新設計分析方法,也未能糾正一些持續(xù)存在的關鍵遺漏,例如缺少電極黏結劑和針對特定分析物的顯色試劑。

結果表明,能夠讀取實驗反饋并調整參數(shù),并不等同于能夠識別研究策略本身的問題,更不等同于進行科學層面的重新規(guī)劃。

圖3.AI智能體在可執(zhí)行規(guī)劃、驗證和實驗室任務下發(fā)各環(huán)節(jié)的表現(xiàn)。

長程規(guī)劃仍然是瓶頸

雖然部分智能體生成了經專家評估可執(zhí)行、且最多包含44個操作步驟的工作流,但在全部測試中,只有3個工作流超過30個操作步驟。這表明,隨著任務鏈條延長,智能體維持實驗邏輯完整性和物理可執(zhí)行性的能力仍面臨顯著挑戰(zhàn)。

重新定義AI的科學能力

研究由此區(qū)分了當前「AI科學家」討論中經常被混為一談的三種能力:一是流暢地生成實驗計劃,二是生成能夠在物理實驗室中實際執(zhí)行的工作流,三是根據(jù)實驗結果調整整體研究策略。

研究結果顯示,語言層面的規(guī)劃能力并不能自動轉化為可靠的實驗執(zhí)行能力,局部參數(shù)調整也不能被直接視為科學層面的重新規(guī)劃。

從「AI測試場」走向「AI訓練場」

作為AI for Science的智能科研基礎設施,機器實驗室既可以成為檢驗AI科學能力的「測試場」,也可以成為推動AI持續(xù)進化的「訓練場」。AI智能體通過機器可讀技能與機器實驗室直接對話,將科學意圖轉化為可執(zhí)行任務,并接收來自機器執(zhí)行、儀器狀態(tài)和實驗結果的真實反饋。

由此形成的「規(guī)劃—執(zhí)行—反饋—重新規(guī)劃」閉環(huán),不僅能夠暴露AI在知識、操作和研究策略層面的缺陷,還可以將成功的工作流、失敗案例、實驗結果和專家評估沉淀為模型訓練與智能體對齊的數(shù)據(jù),持續(xù)迭代AI模型及其智能體系統(tǒng)。

機器科學家由此為回答「我們如何判斷人工智能是否已經足夠聰明,能夠從事科學研究?」提供可量化、可重復、可驗證的物理世界證據(jù),并推動AI從生成實驗方案,逐步走向涵蓋科學問題提出、實驗設計、機器人執(zhí)行、數(shù)據(jù)分析和證據(jù)驅動重新規(guī)劃的端到端自主科學發(fā)現(xiàn)。

圖4.開放科學問題下AI-機器科學家的五輪迭代。

參考資料:

https://arxiv.org/abs/2607.23045

編輯:LRST

關鍵詞 科學 實驗 機器人 工作流 智能體 中國

相關推薦

主站蜘蛛池模板: 一区二区三区四区视频在线观看| 国产精品亚洲片夜色在线| 婷婷亚洲婷婷综合色香五月| 日韩一区国产在线观看| 久久69精品久久久久久久电影好| 国产精品福利网| 国产成人精品久久| 日韩一级在线免费观看| 成人国产精品久久久久久亚洲| 久久精品无码中文字幕| 午夜精品免费视频| 91精品久久久久| 99精品国产高清在线观看| 国产日本欧美视频| 久久本道综合色狠狠五月| 久久久在线视频| 欧美国产激情视频| 欧美亚洲激情视频| 日韩中文字幕在线不卡| 国产精品一区二区av| 亚洲中文字幕无码中文字| 国产日韩精品视频| 亚洲午夜精品一区二区| 国产精品久久久av| 国产精品久久久久久久久免费看 | 国产精品视频999| 国产自产在线视频一区| 国严精品久久久久久亚洲影视| 国语精品免费视频| 国产精品久久久久久av下载红粉| 久久国产日韩欧美| 国产综合第一页| 国产精品乱码视频| 在线天堂一区av电影| 婷婷久久伊人| 人妻无码视频一区二区三区| 久久久久久噜噜噜久久久精品| 精品午夜一区二区三区| 国产精品三级在线| 夜夜添无码一区二区三区| 日韩视频第二页|