隨著生成式人工智慧(AI)快速發展,中國正加速推動構建具備「中國特色」的高質量數據集,意圖打破由英文及西方思維主導的AI訓練數據格局,並在全球AI科技競爭中爭奪更大的話語權。
《紐約時報》報道,早在ChatGPT問世初期,中國研究人員測試發現,該模型不僅將前NBA巨星姚明誤植為「第一位在美國打職業籃球的中國女性」,亦混淆《西遊記》與《紅樓夢》等古典名著,更被指產生大量對華偏見言論。北京當局認為,全球主流AI系統主要依賴英文數據集訓練,在敏感議題上往往反映西方立場,這對中國而言構成了戰略弱點。
藍圖計劃2028年前建數據強國
為彌補這一差距,國家數據局今年早些時候公布藍圖,計劃在2028年底前將中國打造成數據強國,並在科學研究、工業製造與自動駕駛等20多個戰略領域建立「高質量」數據集。中國信息通信研究院院長余曉暉指出,AI時代的競爭不僅是模型與算力的競爭,更是高質量數據供給的競爭。
同時,北京積極推動數據在全球範圍內的共享。在上月於上海舉行的世界人工智慧大會上,中國承諾與數十個發展中國家共享數據,協助其構建各自的AI系統,試圖將更多國家吸引至中國的AI軌道,並縮短與美國的差距。
然而,中國的數據擴張戰略亦引發西方分析人士的疑慮,擔心此舉將擴大中國官方宣傳的影響力。《自然》雜誌近期發表的一項研究顯示,中國官方的敘事方式已開始滲透至ChatGPT與Claude等美國模型的訓練數據中。專家指出,隨著低成本中國AI模型在全球普及,北京正藉由數據輸出,重塑全球數位空間的資訊生態。
封面圖片來源:「2026世界人工智能大會暨人工智能全球治理高級別會議」7月17至20日在上海舉行。中央社

