這對人工智能而言,是一個很有意思的時刻。長久以來,AI 的進展一直遵循一條簡單規則:把模型做得更大。更多參數、更多數據、更多算力。這種方法確實有效,但也帶來了嚴重問題。訓練大型模型成本高昂、速度緩慢,而且會消耗大量能源。
最近,Nvidia 提出了一個不同的概念,叫做 Mixture of Experts,簡稱 MOE。它不會在每項任務上都啟動整個神經網絡,而是讓模型學會選擇系統中實際需要用到的部分。每一部分都像是在某個特定領域的專家。面對任何一個問題時,系統只會動用最相關的專家。
這讓系統更高效,也更靈活。這和人類的工作方式很相似。你不會在每個問題上都向你認識的每一個人求助,而是會找最適合當下情況的人。透過 MOE,AI 系統可以在不變得過度笨重的情況下,持續變得更聰明。
許多研究人員相信,這個方向對人工通用智能(AGI)的長遠目標相當重要。能夠處理多種不同問題的系統,不能只靠規模夠大,還需要具備決策能力。它需要知道該在何時運用哪些能力。
這個想法並不只存在於研究論文之中。
事實上,我們在 Dvina 也一直採用相似的方法。從一開始,我們就假設沒有任何單一語言模型或工具能夠樣樣精通。我們沒有依賴單一模型,而是建立了一個協調層,置於多個模型、工具和數據來源之上。
這個協調層充當決策層。當使用者提出問題時,它會決定應該使用哪個模型或資源。有時只用一個;有時則會結合多個,並整合結果。目標不是展示複雜性,而是把複雜性隱藏在簡單的體驗背後。
最終形成的是一個讓人感覺具備適應性的系統。你提出問題,系統就會找出最高效的回答方式。這在精神上與 MOE 在模型層面所提出的概念非常接近,只是應用在系統層面。
AGI 尚未到來。但像 MOE 這樣的想法顯示,前路不只是關乎規模,還關乎結構、協調,以及更聰明地運用資源。
If you are curious what this kind of approach feels like in practice, you can try Dvina for free at https://dvina.ai. It is not AGI, but it gives a small glimpse into how future AI systems may think and operate.

