現在是人工智慧一個很有意思的時刻。很長一段時間以來,AI 的進展遵循著一條簡單規則:把模型做得更大。更多參數、更多資料、更多算力。這種方法確實有效,但也帶來了嚴重問題。訓練大型模型成本高昂、速度緩慢,而且會消耗大量能源。
最近,Nvidia 提出了一個不同的概念,叫做 Mixture of Experts,也就是 MOE。它不是在每個任務上都啟動整個神經網路,而是讓模型學會選擇系統中實際需要的部分。每個部分都像是在特定領域中的專家。面對任何一個問題時,只有最相關的專家會被啟用。
這讓系統更有效率,也更有彈性。這和人類的工作方式很相似。你不會在每個問題上都向你認識的每一個人求助。你會去找最適合那個情境的人。透過 MOE,AI 系統可以在不變得過度笨重的情況下持續變得更聰明。
許多研究人員認為,這個方向對於人工通用智慧(AGI)的長期目標至關重要。能夠處理多種不同問題的系統,不能只靠規模變大。它需要決策能力。它需要知道該在何時運用哪些能力。
這個想法並不只存在於研究論文中。
事實上,我們在 Dvina 中一直採用相似的方法。從一開始,我們就假設沒有任何單一語言模型或工具能夠樣樣精通。我們沒有依賴單一模型,而是建立了一個位於多個模型、工具與資料來源之上的協調層。
這個協調層扮演決策層的角色。當使用者提出問題時,它會決定應該使用哪個模型或資源。有時候只用一個;有時候則會結合多個,並整合結果。目標不是展示複雜性,而是把複雜性隱藏在簡單的體驗背後。
最終形成的是一個讓人感覺能夠自適應的系統。你提出問題,系統就會找出最有效率的回答方式。這在精神上與 MOE 在模型層提出的概念非常接近,只是我們把它應用在系統層。
AGI 尚未到來。但像 MOE 這樣的想法顯示,前進的道路不只是擴大規模而已。更關鍵的是結構、協調,以及更聰明地運用資源。
If you are curious what this kind of approach feels like in practice, you can try Dvina for free at https://dvina.ai. It is not AGI, but it gives a small glimpse into how future AI systems may think and operate.

