यह artificial intelligence के लिए एक दिलचस्प समय है। लंबे समय तक, AI में प्रगति एक सरल नियम का पालन करती रही: मॉडलों को बड़ा बनाओ। ज़्यादा parameters, ज़्यादा data, ज़्यादा compute। यह काम करता था, लेकिन इससे गंभीर समस्याएँ भी पैदा हुईं। बड़े मॉडलों को train करना महंगा है, धीमा है, और बहुत अधिक ऊर्जा खपत करता है।
हाल ही में, Nvidia ने एक अलग विचार पेश किया जिसे Mixture of Experts, या MOE, कहा जाता है। हर काम के लिए पूरे neural network को सक्रिय करने के बजाय, मॉडल यह सीखता है कि सिस्टम के कौन-से हिस्से वास्तव में ज़रूरी हैं। हर हिस्सा किसी विशेष क्षेत्र के विशेषज्ञ की तरह काम करता है। किसी भी दिए गए प्रश्न के लिए, केवल सबसे प्रासंगिक experts का उपयोग किया जाता है।
इससे सिस्टम अधिक efficient और अधिक flexible बनता है। यह कुछ हद तक वैसा है जैसे लोग काम करते हैं। आप हर समस्या पर मदद के लिए अपने जानने वाले हर व्यक्ति से नहीं पूछते। आप उन्हीं से पूछते हैं जो उस स्थिति के लिए सबसे उपयुक्त हों। MOE के साथ, AI systems अनावश्यक रूप से भारी बने बिना अधिक स्मार्ट हो सकते हैं।
कई शोधकर्ताओं का मानना है कि यह दिशा Artificial General Intelligence, यानी AGI, के दीर्घकालिक लक्ष्य के लिए महत्वपूर्ण है। ऐसा सिस्टम जो कई तरह की समस्याओं को संभाल सके, उसे केवल बड़े आकार से अधिक की ज़रूरत होती है। उसे निर्णय लेने की क्षमता चाहिए। उसे यह जानना चाहिए कि कौन-सी क्षमताओं का उपयोग कब करना है।
यह विचार केवल research papers तक सीमित नहीं है।
दरअसल, Dvina में हम एक मिलते-जुलते दृष्टिकोण पर काम कर रहे हैं। शुरुआत से ही हमारा मानना था कि कोई एक language model या tool हर चीज़ में अच्छा नहीं हो सकता। एक ही मॉडल पर निर्भर रहने के बजाय, हमने एक orchestrator layer बनाई जो कई models, tools, और data sources के ऊपर बैठती है।
यह orchestrator एक decision layer की तरह काम करता है। जब कोई उपयोगकर्ता कोई प्रश्न पूछता है, तो यह तय करता है कि कौन-सा model या resource इस्तेमाल किया जाना चाहिए। कभी यह एक का उपयोग करता है। कभी यह कई को मिलाकर परिणामों को merge करता है। लक्ष्य जटिलता दिखाना नहीं, बल्कि उसे एक सरल अनुभव के पीछे छिपाना है।
नतीजा एक ऐसा सिस्टम है जो अनुकूलनशील महसूस होता है। आप एक प्रश्न पूछते हैं, और सिस्टम यह समझ लेता है कि उसका उत्तर सबसे efficient तरीके से कैसे देना है। भावना के स्तर पर यह MOE के मॉडल-स्तरीय प्रस्ताव के बहुत करीब है, लेकिन इसे सिस्टम स्तर पर लागू किया गया है।
AGI अभी तक नहीं आया है। लेकिन MOE जैसे विचार दिखाते हैं कि आगे का रास्ता केवल scale के बारे में नहीं है। यह structure, coordination, और resources के अधिक स्मार्ट उपयोग के बारे में है।
If you are curious what this kind of approach feels like in practice, you can try Dvina for free at https://dvina.ai. It is not AGI, but it gives a small glimpse into how future AI systems may think and operate.

