DeepSeek
DeepSeek橫空出世
在全球人工智慧(AI)軍備競賽愈演愈烈之際,美國科技巨頭大舉投入數十億美元建設數據中心和超級計算機,以開發尖端深度學習模型。然而,就在聖誕節後一天,一家名為 DeepSeek 的中國初創公司橫空出世,以突破性的 AI 模型 DeepSeek-V3 在業界掀起巨大波瀾。該模型的性能據稱可與 OpenAI 和 Google 等公司的最先進聊天機器人匹敵,並且其研發成本僅為少數巨頭的一小部分,顛覆了業界對深度學習成本門檻的認知。
DeepSeek低成本高性能
DeepSeek 的工程師團隊在技術研究論文中解釋了其突破背後的原因。他們僅使用美國領先 AI 公司訓練系統所需專用計算晶片的一小部分,依靠約 600萬美元的計算力 完成了 DeepSeek-V3 的訓練。相比之下,像 Meta 這樣的科技巨頭通常需要 16,000 個以上的專用晶片訓練其最新的 AI 模型,而 DeepSeek 僅使用了約 2,000 顆NVIDIA晶片。這樣的規模與成本對比,凸顯了 DeepSeek 在資源使用效率和技術創新上的獨特優勢。
DeepSeek-V3 模型擁有 6,710 億個參數,結合了 Mixture-of-Experts(MoE)架構,在多項基準測試中表現亮眼,甚至超越了 Meta 的 Llama 和阿里巴巴的 Qwen 等領先模型。這讓外界開始反思:是否中國技術團隊在美國貿易限制下,因為資源受限而激發了更多的創意與實用性?
Meta內部動盪
DeepSeek 的成功不僅震撼了全球 AI 社群,也引發了美國科技巨頭的內部焦慮。根據匿名職場爆料平台 Blind 上的貼文,一名自稱是 Meta 生成式 AI 部門的工程師透露,DeepSeek-V3 的橫空出世讓 Meta 最新的 Llama 4 相形見絀,甚至被形容為「被中國一家預算僅 550 萬美元的公司狠狠打臉」。該工程師更直言,Meta 的生成式 AI 部門高昂的運營成本正受到質疑,「部門的每一位領導的年薪都比訓練 DeepSeek-V3 的總成本還高,而這樣的領導我們有幾十個。」
內部文件顯示,Meta 工程師已投入大量時間研究 DeepSeek 模型,試圖「抄襲任何可以抄襲的東西」。文件作者甚至批評 Meta 的組織文化,稱其過度追求「影響力」和「人頭數」,導致效率低下,最終「所有人都成了輸家」。
更令人不安的是,這場競賽可能還遠未結束。據文件爆料,DeepSeek 新一代的模型 DeepSeek R1 很快將公開。雖然具體資訊尚未披露,但已有跡象表明其性能有望再次挑戰美國科技巨頭的技術地位。
DeepSeek 的成功不僅是一個技術里程碑,也對全球 AI 行業的現狀提出了深刻的質疑:是否巨額資本和龐大的組織架構是實現創新和進步的唯一途徑?DeepSeek 的出現證明,即便在資源有限的情況下,通過技術創新和高效執行,同樣可以打造出世界一流的 AI 系統。






