ஒளிரும் தலைப்புச் செய்திகள் பின்னால், AI துறை புதுமையின் வேகம், மூலதனத்தின் நிலைத்தன்மை, மற்றும் மாடல் உருவாக்குநர்கள் மற்றும் பயன்பாட்டு தீர்வு உருவாக்குநர்கள் எடுத்துச் செல்லும் வேறுபட்ட பாதைகள் குறித்து அடிப்படை கேள்விகளுடன் போராடுகிறது.
துறையின் அமைதியான திருப்புமுனை
கடந்த மூன்று ஆண்டுகளில் செயற்கை நுண்ணறிவு இதுவரை இல்லாத வேகத்தில் வளர்ந்துள்ளது. ChatGPT வெளியானதிலிருந்து, நுகர்வோர் ஏற்றுக்கொள்ளுதல் சாதனைகளை முறியடித்துள்ளது; OpenAI முதல் Google வரை உள்ள மாபெரும் நிறுவனங்கள் தொடர்ச்சியாக மாடல்களை அறிவித்துள்ளன; மேலும் Fortune 500 நிறுவனங்கள் AI-ஐ தங்களின் வணிக செயல்முறைகளின் மையமாக வைத்துள்ளன. ஆனால் இன்று, ஒளிரும் தலைப்புச் செய்திகள் பின்னால், இந்தத் துறை முற்றிலும் வேறுபட்ட ஒரு கேள்வியுடன் போராடுகிறது:
உண்மையான புதுமை இன்னும் வலுவான வேகத்துடன் முன்னேறிக்கொண்டிருக்கிறதா, அல்லது கண்களுக்கு புலப்படாத வரம்புகளை மோதும் ஒரு மாபெரும் இயந்திரத்தையா நாம் பார்த்துக்கொண்டிருக்கிறோம்?
இந்தக் கேள்விக்கு சரியாகப் பதிலளிக்க, இந்த சூழலமைப்பை இரண்டு தனித்துவமான கோணங்களில் பார்க்க வேண்டும்:
முதன்மை சந்தை: GPT-4, Claude, மற்றும் Gemini போன்ற அடித்தள மாடல்களை உருவாக்கும் நிறுவனங்கள்: OpenAI, Anthropic, Google DeepMind, Meta.
இரண்டாம் நிலை சந்தை: இந்த மாடல்களை எடுத்துக்கொண்டு, பயனர்களின் நிஜப் பிரச்சினைகளுக்கான தீர்வுகளை உருவாக்கும் நிறுவனங்கள்: Perplexity, Cursor, Notion AI, Replit.
இரண்டு சந்தைகளும் ஒரே துறைக்குள் இருந்தாலும், அவற்றின் இயக்கவியல், செலவுக் கட்டமைப்புகள், ஆபத்து சுயவிவரங்கள், மற்றும் வளர்ச்சி எதிர்பார்ப்புகள் அடிப்படையில் வேறுபட்டவை. இன்று நாம் காணும் பதற்றம் துல்லியமாக இந்தப் பிளவிலிருந்தே உருவாகிறது.
மாடல் உருவாக்கத்தின் இயற்கை வரம்புகள் வெளிப்படத் தொடங்குகின்றன
கடந்த ஐந்து ஆண்டுகளில் பெரிய மொழி மாடல்களின் பரிணாமத்தை நான்கு அடிப்படை காரணிகள் வடிவமைத்துள்ளன:
- மாடலின் அளவு (parameter count)
- பயிற்சி தரவு (தரம் மற்றும் பல்வகைமை)
- கணக்கீட்டு திறன் (GPU/TPU capacity)
- பயிற்சி நுட்பங்கள் (transformer architectures, attention mechanisms)
2018 முதல் 2023 வரை, இந்த நான்கு காரணிகளும் ஒரே திசையில் அளவுபடுத்தப்பட்டதால், மிகப்பெரிய முன்னேற்றங்கள் ஏற்பட்டன. இப்படித்தான் நாம் GPT-2 இலிருந்து GPT-4-க்கு, BERT இலிருந்து PaLM-க்கு முன்னேறினோம். ஆனால் இந்த வளைவு முடிவில்லாமல் தொடராது. பயிற்சி தரவு இப்போது இந்தத் துறையின் மிக முக்கியமான bottleneck ஆக மாறியுள்ளது.
உயர் தரமான, பல்வகைத் தன்மை கொண்ட, மனிதர்கள் உருவாக்கிய அசல் தரவுக் களஞ்சியங்கள் வரம்புடையவை. நீங்கள் Wikipedia-வில் பயிற்சி பெறுகிறீர்கள், arXiv-ல் பயிற்சி பெறுகிறீர்கள், GitHub-ல் பயிற்சி பெறுகிறீர்கள்: அதன் பிறகு என்ன? காப்புரிமைச் சிக்கல்கள், தரவு உரிமை ஒப்பந்தங்கள், மற்றும் அணுகல் கட்டுப்பாடுகள் காரணமாக இந்த துறையில் செலவுகள் அதிவேகமாக உயர்ந்து வருகின்றன. நீங்கள் Reddit-உடன் ஒப்பந்தங்கள் செய்கிறீர்கள், Stack Overflow-உடன் பேச்சுவார்த்தை நடத்துகிறீர்கள், The New York Times-இன் வழக்குகளை எதிர்கொள்கிறீர்கள். மாடல்களின் அளவை அதிகரிப்பது இன்னும் தொழில்நுட்ப ரீதியாக சாத்தியமே, ஆனால் தரவு சார்ந்த பகுதி இயல்பான ஒரு உச்சவரம்பை உருவாக்குகிறது.
அதனால்தான் துறை தனது கவனத்தை மாடல்களின் அளவிலிருந்து செயல்திறன் நோக்கி மாற்றியுள்ளது. Chain-of-thought reasoning, reinforcement learning from human feedback (RLHF), மேலும் பயனுள்ள sampling techniques, mixture-of-experts (MoE) architectures: இவை அனைத்தும் இந்த மாற்றத்தின் பகுதிகளாகும்.
இந்த முன்னேற்றங்கள் முக்கியமானவை, ஆனால் இவை மட்டும் தனித்து நிலைத்திருக்கக் கூடியவை அல்ல. ஏனெனில் ஒரு கட்டத்தில், செயல்திறன் மேம்பாடுகளும் நிறைவு நிலையை அடைகின்றன. அடித்தள மாடல் புதுமை இப்போது மெதுவாகவும் அதிகச் செலவுடனும் நகரும் ஒரு கட்டத்துக்குள் நுழைந்துவிட்டது என்பதை துறை உணரத் தொடங்கியுள்ளது.
மூலதன ஓட்டத்தின் அழுத்தமும் அதிகரிக்கும் பலவீனமும்
தொழில்நுட்ப வரம்புகள் தெளிவாக உணரப்படத் தொடங்கியபோது, மூலதனப் பக்க வளர்ச்சி இன்னும் அதிக ஆபத்தானதாக மாறியுள்ளது.
அடித்தள மாடல் நிறுவனங்கள் மிகப்பெரிய கணக்கீட்டு உள்கட்டமைப்புகளை உருவாக்கி, திறமையாளர்களுக்கான போட்டியில் தீவிரமான சலுகைகளை முன்வைக்கின்றன. வலுவான வருவாய் அடித்தளங்கள் உருவாகும் முன்பே இந்தச் செலவுகள் நடைபெற்று வருகின்றன. OpenAI-யின் ஆண்டு கணக்கீட்டு செலவுகள் பில்லியன் டாலர் அளவை எட்டுகின்றன. Anthropic, Microsoft-இலிருந்து பில்லியன் கணக்கில் முதலீடு பெறுகிறது. Google, DeepMind-க்காக தனி பட்ஜெட்டை ஒதுக்குகிறது.
தரவு மையங்களில் முதலீடு செய்யப்பட்ட பில்லியன்கள், பல ஆண்டுகள் நீளும் GPU ஒப்பந்தங்கள், Ilya Sutskever போன்ற பெயர்களுக்கு வழங்கப்படும் வானளாவிய சம்பளங்கள்: இவை நிறுவனங்களின் செலவுக் கட்டமைப்பை கடுமையாக உயர்த்துகின்றன.
இந்தப் படம், முதன்மை சந்தை பொருளாதார ரீதியாக மிகவும் பலவீனமான scaling model-ஐ அடிப்படையாகக் கொண்டு கட்டமைக்கப்பட்டுள்ளது என்பதை காட்டுகிறது. மாடல் புதுமையின் செலவுக் கட்டமைப்பு, வருவாய் வளர்ச்சி விகிதங்களை விட மிகவும் அதிகமாக உள்ளது.
அமைதியாக உயர்ந்து வரும் பயன்பாட்டு அடுக்கு
முதன்மை சந்தை அழுத்தத்தில் இருக்கும் போது, இரண்டாம் நிலை சந்தை ஒப்பீட்டளவில் ஆரோக்கியமான வளர்ச்சி வளைவுடன் முன்னேறுகிறது. இந்த நிறுவனங்கள் அடித்தள மாடல்களை எடுத்துக்கொண்டு அவற்றை நிஜமான பயன்பாட்டு நிலைகளாக மாற்றுகின்றன.
- Perplexity: தேடல் அனுபவத்தை மறுவடிவமைத்தல்
- Cursor & Replit: குறியீட்டுப் பணிச்சூழலை மாற்றுதல்
- Notion AI: உற்பத்தித்திறன் கருவிகளை நுண்ணறிவூட்டுதல்
- Dvina: 120+ பயன்பாடுகளுடன் இணைந்து, ஒரே நுண்ணறிவு அடுக்கிலிருந்து முழு டிஜிட்டல் வாழ்க்கையையும் நிர்வகித்தல்
இந்த நிறுவனங்களின் முன்னிலை, பயனருக்கு மிக அருகில் இருப்பதில்தான் உள்ளது. உண்மையான மதிப்பு நேரடியாக பயனர் அனுபவத்திலேயே உருவாகிறது. தேடல், குறியீட்டெழுதல், உள்ளடக்க உருவாக்கம், உற்பத்தித்திறன், தகவல் செயலாக்கம்: இவை அனைத்தும் விரிவாக்கக்கூடியதும் புரிந்துகொள்ளக்கூடியதுமான வருவாய் மாதிரிகளை வழங்குகின்றன.
அதனால்தான் பல அடித்தள மாடல் தயாரிப்பாளர்கள் பயன்பாட்டு அடுக்கிற்குத் திரும்பத் தொடங்கியுள்ளனர். OpenAI, ChatGPT-ஐ ஒரு தயாரிப்பாக மாற்றியது; Anthropic, Claude-ஐ நுகர்வோர் வழங்கலாக மாற்றியது; Google, Gemini-ஐ ஒருங்கிணைத்தது. Vertical integration strategy மிக வேகமாக பரவியுள்ளது.
ஆனால் இந்தத் திட்டம் பக்கவிளைவுகளையும் ஏற்படுத்தியுள்ளது: வாடிக்கையாளர் சேர்த்தல் செலவுகள் வானளாவிய அளவுக்கு உயர்ந்துள்ளன, இரண்டாம் நிலை சந்தை மதிப்பீடுகள் ஊதிப்போயுள்ளன. வருவாய் உருவாக்கக்கூடிய ஒரே பகுதியான இரண்டாம் நிலை சந்தை இவ்வளவு விலையுயர்ந்ததாக மாறியிருப்பது, இந்தத் துறையின் மூலதன ஆபத்தை மேலும் பெருக்குகிறது.
வரலாற்றுச் சுழற்சிகளும் இன்றைய வேறுபடுத்தும் காரணியும்
செயற்கை நுண்ணறிவு கடந்த காலத்தில் இரண்டு பெரிய சரிவுகளை அனுபவித்துள்ளது: 1970களின் இறுதி மற்றும் 1990களின் தொடக்கம். அந்தக் காலகட்டங்களுக்கு பொதுவான அம்சங்கள்: மிக உயர்ந்த எதிர்பார்ப்புகள், குறைந்த புதுமை வேகம், மற்றும் மறைந்து போன முதலீட்டு ஆர்வம்.
இன்றைய நிலைமை வேறுபட்டது. தொழில்நுட்ப புதுமை தொடர்கிறது, ஆனால் பெரிய முன்னேற்றங்களின் வேகம் மந்தமாகிறது. ஆனால் மூலதன ஓட்டம், இதற்கு முன் இல்லாத அளவில் வளர்கிறது. Sam Altman $7 trillion compute fund பற்றி பேசுகிறார், Elon Musk xAI-க்குள் பில்லியன்களை செலுத்துகிறார்.
ஆகையால், நாம் அனுபவிப்பது ஒரு வழக்கமான "AI winter" அல்ல. இது மூலதன ஒதுக்கீட்டை அடிப்படையாகக் கொண்ட ஒரு பலவீனக் காலகட்டம் போன்றது: மதிப்பீடுகள் ஊதிப்போகின்றன, செலவுகள் வேகமாக அதிகரிக்கின்றன, ஆனால் புதுமையின் வேகம் எதிர்பார்ப்புகளை பூர்த்தி செய்யவில்லை.
புதிய காலம்: பெரிய மாடல்கள் அல்ல, புத்திசாலித்தனமான அணுகுமுறைகள்தான் வெல்லும்
இன்றைய மிக முக்கியமான வேறுபாடு இதுதான்: இப்போது முக்கியமானது, மேலும் அதிக parameters சேர்த்து இன்னும் மாபெரும் மாடல்களை உருவாக்குவது அல்ல.
உண்மையான மாற்றம் இந்த துறைகளில் நிகழும்:
- அளவுரு செயல்திறனை அதிகரித்தல்
- சிறிய மாதிரிகளிலேயே உயர்ந்த தரத்தை அடைதல்
- புதிய பயிற்சி நுட்பங்களை உருவாக்குதல்
- தரவை மேலும் மூலோபாயமாகவும் பயனுள்ளதாகவும் பயன்படுத்துதல்
- பயிற்சி செலவுகளை அடிப்படையாகக் குறைத்தல்
சமீபத்திய மிகவும் குறிப்பிடத்தக்க உதாரணங்களில் ஒன்று DeepSeek. இந்த சீன ஸ்டார்ட்அப் GPT-4 நிலை செயல்திறன் கொண்ட ஒரு மாதிரியை உருவாக்கியது: ஆனால் மிகவும் குறைந்த பயிற்சி செலவில். Mixture-of-experts கட்டமைப்பு, அளவுரு மேம்படுத்தல், செயல்திறன்-மையப்படுத்தப்பட்ட பயிற்சி நுட்பங்கள். சந்தை இதற்கு வலுவாகப் பதிலளித்தது.
DeepSeek-ன் அறிவிப்பைத் தொடர்ந்து, NVIDIA-வின் சந்தை மதிப்பு ஒரே நாளில் $600 billion குறைந்தது. இதனால், முதலீட்டாளர்கள் இப்போது பெரிய மாதிரிகளுக்கான போட்டியை மட்டும் அல்லாமல், செயல்திறன் மற்றும் கட்டமைப்பு புதுமைக்கான போட்டியையும் கவனித்து வருகிறார்கள் என்பது தெளிவானது.
ஆனால் இதுவும் இன்னும் போதுமானதல்ல. இந்த துறை உண்மையான ஒரு தாவலை அனுபவிக்க வேண்டுமெனில், அது புதிய கட்டமைப்பு பரடைக்ம்கள் வழியாகவே வரும். transformer கட்டமைப்பைத் தாண்டிய ஏதோ ஒன்று. ஒருவேளை neuromorphic computing, ஒருவேளை hybrid மாதிரிகள், அல்லது முற்றிலும் வேறுபட்ட ஒரு கற்றல் வடிவமைப்பு.
இத்தகைய தீவிரமான மாற்றங்கள் பொதுவாக பெரிய நிறுவனங்களிலிருந்து வருவதில்லை. அளவின் அழுத்தம், உள்கட்டமைப்பு செலவுகள், மற்றும் நிறுவன ரிஸ்க் மேலாண்மை காரணமாக அவை எச்சரிக்கையுடன் செயல்படுகின்றன. உண்மையான முன்னேற்றங்கள் பெரும்பாலும் சிறிய, தாக்குதல்மிகு, அபாயத்தை ஏற்கத் தயங்காத, உயர்வாசை கொண்ட ஸ்டார்ட்அப்புகளிலிருந்தே உருவாகின்றன.
இன்றைய AI சூழல், இப்படிப்பட்ட ஒரு இடையூறு மாற்றத்தைக் காத்திருக்கக்கூடும்.
முடிவு: வெல்லப்போவது வளங்கள் அல்ல, அணுகுமுறையே
இன்றைய AI துறை இரண்டு பதட்டங்களுக்கிடையில் அலைகிறது: ஒரு புறம், தனது வரம்புகளுக்கு நெருங்கிக் கொண்டிருக்கும் மாதிரி-அளவீட்டு மூலோபாயம்; மறுபுறம், அதிகரித்து வரும் மூலதன அபாயங்களும் வேகமாக மதிப்பு உயர்ந்து வரும் பயன்பாட்டு சந்தையும்.
இந்தப் படம் இப்போது அடிப்படைப் பிரச்சினை திறன் அல்ல, அணுகுமுறையே என்பதை காட்டுகிறது. நாளைய வெற்றியாளர்கள் பெரிய மாதிரிகளை உருவாக்குபவர்கள் அல்ல; புத்திசாலித்தனமான முறைகளை உருவாக்குபவர்கள்தான். செயல்திறன், புதிய கட்டமைப்பு வடிவமைப்புகள், மற்றும் மேம்படுத்தப்பட்ட பயிற்சி நுட்பங்கள் ஆகியவை இந்தத் துறையின் உண்மையான வேறுபாட்டுக் கோடாக மாறி வருகின்றன.
எதிர்காலத்தில் தீர்மானிப்பது வளங்களின் வலிமை அல்ல, அணுகுமுறையின் தரமே. மேலும், பெரிய நிறுவனங்களை விட தொலைநோக்கு கொண்ட ஸ்டார்ட்அப்புகளே இந்த அணுகுமுறை மாற்றத்தைத் தொடங்கும் வாய்ப்பு மிகவும் அதிகம்.

