지금은 인공지능에 있어 흥미로운 순간입니다. 오랫동안 AI의 발전은 단순한 규칙을 따라왔습니다. 모델을 더 크게 만드는 것이었죠. 더 많은 파라미터, 더 많은 데이터, 더 많은 연산. 이 방식은 효과가 있었지만, 동시에 심각한 문제도 만들었습니다. 대규모 모델을 학습시키는 일은 비용이 많이 들고, 느리며, 막대한 에너지를 소비합니다.
최근 Nvidia는 Mixture of Experts, 즉 MOE라는 다른 아이디어를 소개했습니다. 모든 작업마다 전체 신경망을 활성화하는 대신, 모델이 실제로 필요한 시스템의 부분이 무엇인지 선택하도록 학습하는 방식입니다. 각 부분은 특정 영역의 전문가처럼 작동합니다. 어떤 질문이 주어지면, 가장 관련성이 높은 전문가들만 사용됩니다.
이렇게 하면 시스템은 더 효율적이고 더 유연해집니다. 사람들의 일하는 방식과도 비슷합니다. 모든 문제마다 아는 모든 사람에게 도움을 요청하지는 않죠. 그 상황에 가장 적합한 사람들에게 묻습니다. MOE를 통해 AI 시스템은 불필요하게 무거워지지 않으면서도 더 똑똑해질 수 있습니다.
많은 연구자들은 이 방향이 인공일반지능, 즉 AGI라는 장기적 목표에 중요하다고 봅니다. 다양한 종류의 문제를 처리할 수 있는 시스템에는 단순한 규모만으로는 충분하지 않습니다. 의사결정이 필요합니다. 어떤 역량을 언제 사용해야 하는지 알아야 합니다.
이 아이디어는 연구 논문에만 국한되지 않습니다.
실제로 Dvina에서도 우리는 비슷한 접근 방식을 적용해 왔습니다. 처음부터 우리는 단 하나의 언어 모델이나 도구가 모든 것을 잘할 수는 없다고 가정했습니다. 하나의 모델에 의존하는 대신, 여러 모델, 도구, 데이터 소스 위에서 작동하는 오케스트레이터 계층을 구축했습니다.
이 오케스트레이터는 의사결정 계층으로 작동합니다. 사용자가 질문을 하면 어떤 모델이나 리소스를 사용해야 할지 결정합니다. 하나만 사용할 때도 있고, 여러 개를 결합해 결과를 합칠 때도 있습니다. 목표는 복잡함을 드러내는 것이 아니라, 그것을 단순한 경험 뒤에 숨기는 것입니다.
그 결과 시스템은 상황에 맞게 적응하는 것처럼 느껴집니다. 질문을 하면, 시스템이 가장 효율적인 방식으로 어떻게 답할지 스스로 판단합니다. 이는 모델 수준에서 MOE가 제안하는 바와 정신적으로 매우 가깝지만, 시스템 수준에 적용된 것입니다.
AGI는 아직 도래하지 않았습니다. 하지만 MOE 같은 아이디어는 앞으로의 길이 단지 규모의 문제가 아니라는 점을 보여줍니다. 그것은 구조, 조율, 그리고 자원을 더 똑똑하게 활용하는 방식에 관한 것입니다.
If you are curious what this kind of approach feels like in practice, you can try Dvina for free at https://dvina.ai. It is not AGI, but it gives a small glimpse into how future AI systems may think and operate.

