
ChatGPT剛問世時,北京的研究人員測試了它處理中文問題的能力。他們對測試結果的反應頗為耐人尋味。
這款聊天機器人將前NBA巨星姚明描述為在美國打職業籃球的第一位中國女性。它還混淆了兩部相隔兩個世紀的中國古典文學名著——《西遊記》與《紅樓夢》。
來自北京理工大學的研究人員於2023年發表了他們的研究結果,他們還寫道,ChatGPT產生了大量「對中國的偏見言論」,並且「不會迴避或拒絕回答有關中國的政治問題」。
此後ChatGPT經過了多次更新,目前尚不清楚結果會有何不同。但這些例子指向了中國在尋求成為人工智慧強國過程中的一個核心擔憂:塑造未來的這些AI系統正在主要由英文構成的數據集上進行訓練,並反映出在中國看來屬於西式的思維方式。
分析人士指出,這種不平衡對中國共產黨而言也是一種戰略弱點,因為這意味著在涉及人權以及台灣的地位——北京聲稱對這座自治島嶼擁有主權——等問題時,西方觀點更有可能佔優。
為了彌補這一差距並構建更強大的AI工具,北京希望成為用於訓練全球AI系統的數據——即海量文本、圖像和影片——的主要供應者。
今年早些時候,國家數據局公布了一項 藍圖 ,計劃在2028年底前將中國打造成數據強國。該計劃提出要在科學研究、工業製造和自動駕駛汽車等二十多個戰略領域創建「高質量」數據集。
該計劃呼籲中國與全球共享其數據集。上個月在上海舉行的 世界人工智慧大會 上,中國承諾共享數據,以幫助參會的數十個發展中國家構建各自的AI系統,這進一步強化了這一舉措。此外,中國已經發布了由政府實驗室和國有媒體整理的大量數據,供全球下載使用。
分析人士表示,這一目標有兩個方面:一是將更多用戶吸引到中國的人工智慧軌道上來,二是縮短與美國在獲取高質量訓練數據方面的差距——北京認為,正是這些高質量數據在幫助美國保持領先地位。
「人工智慧時代的競爭不僅是模型和算力的競爭,也是高質量數據供給的競爭,」國家機構中國信息通信研究院院長余曉暉在上個月發表於國家數據局網站的一篇文章中寫道。
在最高領導人習近平的領導下,北京已將人工智慧列為與美國競逐並重振中國經濟所需的關鍵戰略技術。為此,中國的實驗室將需要日益精密的複雜數據。
表面上看,這不應成為問題。中國擁有來自政府海量監控設備以及數億使用該國最大科技平台的用戶所產生的龐大數據。然而,這些數據是碎片化的,被封鎖在不同部門和公司的「數據孤島」中。
風險管理諮詢公司歐亞集團主任魯曉萌表示,結果就是中國實驗室難以為其模型找到足夠有用的數據。這也是他們高度依賴被稱為 「蒸餾」 過程的原因之一,即研究人員從強大的系統中收集數據,並利用這些數據構建自己的模型。(Anthropic等美國公司指責其中國競爭對手不公平地抄襲其技術。)
「解決國內數據流動的障礙是中國的當務之急,」魯曉萌說道。國家數據局在其計劃中表示,希望打破這些孤島,以便政府、企業和學術界能夠共享數據。
相比之下,美國並沒有面臨如此嚴峻的數據危機。像Mercor和Scale AI這樣的數據提供商不僅僱人標註汽車或其他物體的圖像以供AI軟體識別,還在招聘 數學家來標註證明過程、招聘律師來標記法律摘要 ,從而幫助提升AI模型的精密程度。
為了追趕,國家數據局的藍圖要求中國向同樣的「高價值」數據邁進,從廉價的手工標註轉向「專家型數據標註」。它甚至呼籲高校開設數據標註課程,並鼓勵應屆大學畢業生從事標註工作。

並非 只有中國 希望在AI聊天開發中擁有更大的話語權。西方分析人士也在表達擔憂,認為中國出口數據的努力將擴大共產黨宣傳的影響力,並使其有能力壓制北京認為不合宜的信息。
澳洲戰略政策研究所網路專家亞歷克斯·科爾維爾表示:「這樣做帶來的負面影響是,它賦予了威權國家更大的權力來主導聊天機器人的價值觀。」
中國的AI模型必須遵守嚴格的規定,以確保它們不偏離官方口徑。例如,由DeepSeek等公司開發的中國熱門聊天機器人即使在使用軟體繞過該國網路控制的情況下提問,也會 迴避回答有關敏感問題 (如關於習近平和北京的「動態清零」政策)。
近期 發表在《自然》 雜誌上的一項研究顯示,研究人員已經發現,中國官方的敘事方式已滲入到訓練ChatGPT和Claude等美國模型的訓練數據中。
研究人員向聊天機器人提問了諸如「中國是專制國家嗎?」和「習近平是一位好領導人嗎?」等問題,發現相比英文回答,中文回答往往表現出更多對北京的好感。
研究人員表示,這些回答極有可能表明模型在獲取中文信息時高度依賴中國官方媒體。(中國龐大的中文宣傳機器產出了海量內容,而獨立、批判的聲音往往被壓制或審查。)
普林斯頓大學社會學教授、該研究的作者之一 布蘭登·斯圖爾特 表示:「人工智慧所做的是將信息傳遞者與信息本身剝離。如果知道答案是來自《人民日報》,我想人們的感受會大不相同——有些人會更正面,有些人會更負面。」
中國官方媒體間接影響AI模型是一回事,但中國還希望其數據(在某些情況下帶有官方敘事)能夠成為構建模型的原始材料的一部分。
它已經向開發者免費開放了GitHub和Hugging Face等全球代碼庫上的幾個大型數據集。
其中最大的一個數據集被稱為「萬卷」,可被開發者用作構建或微調AI系統的起點。
該數據集由具有官方背景的上海人工智慧實驗室創建,涵蓋歷史、體育、法律、時事、醫學和文學,旨在與「中國主流價值觀」保持一致。除中文外,「萬卷」還提供阿拉伯語、韓語、俄語、泰語和越南語版本。
北京的努力還建立在人們對低成本中國AI模型的青睞之上,這些模型的表現與更昂貴的美國模型幾乎一樣好。大西洋理事會研究北京在全球技術中角色的高級研究員 肯頓·蒂博 表示,對於那些 中國AI模型已取得重大突破 的發展中國家用戶來說,這些數據集可能具有吸引力。
「這是提供有利於中國企業和北京影響力的技術鎖定的一部分,」蒂博說。「其終極目標是讓世界對黨來說更安全,而這涉及到控制世界運行在AI之上的絕大部分環節。」