MoneyDJ新聞 2026-08-07 10:59:34 新聞中心 發佈
綜合陸媒報導,據《晚點 LatePost》報導,字節跳動正討論訓練一款參數規模超過5兆的模型,規模將超越阿里巴巴(9988.HK)Qwen 3.8-Max的2.4兆參數和月之暗面(Moonshot AI)Kimi K3的2.8兆參數,有望成為目前中國國內已知參數規模最大的模型。不過,該計畫仍處於早期階段,不代表模型最終一定會發布。新模型將由Seed Foundation負責人項亮主導,與大語言模型預訓練數據負責人沈科合作。為此,Seed正在重新梳理組織,劃分職責及分配資源。
2月中旬,Seed負責人吳永輝執掌Seed後推出的關鍵模型Seed 2.0正式發布,但市場反應有限;相較之下,智譜(2513.HK)開源的GLM-5被市場視為是中國國內第一個能與Anthropic Opus系列比肩的模型,而月之暗面的Kimi K3發布,多項第三方評測認為,它已接近海外閉源旗艦。據悉,Seed許多團隊也在不斷反思,這是字節討論訓練超過5兆參數模型的原因之一,與其在現有尺寸上繼續追趕,不如把參數規模一次推到同行的數倍,爭取領先位置。
字節跳動創辦人張一鳴日前在Seed全員會上表示,訓練大模型本就是一件很難的事,團隊不必過度焦慮,他明確一段時間內可接受模型落後於行業,希望大家以追求智慧上限為目標,期待Seed模型能力能躋身世界第一梯隊。他並認為,程式設計是目前的關鍵方向,並表態自己反對蒸餾,在他看來,蒸餾能在短期內改善模型表現,但本質上仍是在複製Claude已有的能力,若沿著這條路走,最多只能不斷逼近對方,很難真正實現超越。