<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>API on kenji.blog</title><link>http://kenji.blog/hi/categories/api/</link><description>Recent content in API on kenji.blog</description><generator>Hugo -- gohugo.io</generator><language>hi</language><copyright>kenjinote</copyright><lastBuildDate>Fri, 11 Sep 2026 12:00:00 +0900</lastBuildDate><atom:link href="http://kenji.blog/hi/categories/api/index.xml" rel="self" type="application/rss+xml"/><item><title>ChatGPT・Gemini・Claude के API की विस्तृत तुलना! आपको कौन सा चुनना चाहिए?</title><link>http://kenji.blog/hi/p/chatgpt-gemini-claude-api-comparison/</link><pubDate>Fri, 11 Sep 2026 12:00:00 +0900</pubDate><guid>http://kenji.blog/hi/p/chatgpt-gemini-claude-api-comparison/</guid><description>&lt;img src="http://kenji.blog/p/chatgpt-gemini-claude-api-comparison/img/eyecatch.jpg" alt="Featured image of post ChatGPT・Gemini・Claude के API की विस्तृत तुलना! आपको कौन सा चुनना चाहिए?" />&lt;h1 id="chatgptgeminiclaude-क-api-क-वसतत-तलन-आपक-कन-स-चनन-चहए">ChatGPT・Gemini・Claude के API की विस्तृत तुलना! आपको कौन सा चुनना चाहिए?
&lt;/h1>&lt;p>AI तकनीक का विकास उल्लेखनीय है, और विशेष रूप से बड़े भाषा मॉडल (LLM: Large Language Model) के क्षेत्र में, OpenAI के ChatGPT (GPT श्रृंखला), Google के Gemini, और Anthropic के Claude एक-दूसरे के साथ वर्चस्व की भयंकर त्रिकोणीय लड़ाई लड़ रहे हैं। 2026 तक, ये कंपनियाँ महीनों या यहाँ तक ​​कि हफ्तों में नए मॉडल और API सुविधाएँ जारी कर रही हैं। डेवलपर्स और एंटरप्राइज़ IT आर्किटेक्ट्स के लिए, &amp;ldquo;हमें अपने उत्पाद में किस API को एकीकृत करना चाहिए?&amp;rdquo; यह प्रश्न एक अत्यंत महत्वपूर्ण निर्णय बन गया है जो किसी परियोजना की सफलता या विफलता को निर्धारित करता है।&lt;/p>
&lt;p>इस लेख में, हम केवल विशिष्टताओं को सूचीबद्ध करने से आगे बढ़ेंगे और इन 3 प्रमुख AI प्रदाताओं के API की पूरी तरह से तुलना और व्याख्या करेंगे - आर्किटेक्चर डिज़ाइन, विस्तृत मूल्य निर्धारण संरचना, विलंबता (latency) का गणितीय विश्लेषण, Python और Node.js का उपयोग करके ठोस कार्यान्वयन उदाहरणों से लेकर, प्रॉम्प्ट कैशिंग (prompt caching) जैसी नवीनतम लागत अनुकूलन तकनीकों तक, वह भी एक डेवलपर के दृष्टिकोण से।&lt;/p>
&lt;p>हमारा उद्देश्य है कि यह पाठकों के लिए एक संपूर्ण मार्गदर्शिका बने जिससे वे अपने उपयोग के मामलों के लिए सर्वश्रेष्ठ LLM API का चयन कर सकें और स्केलेबल तथा लागत-प्रभावी AI एप्लिकेशन का निर्माण कर सकें।&lt;/p>
&lt;hr>
&lt;h2 id="1-परतयक-llm-api-क-दरशन-और-डजइन-वचरधर">1. प्रत्येक LLM API का दर्शन और डिज़ाइन विचारधारा
&lt;/h2>&lt;p>तकनीक के चयन में, सबसे पहले यह समझना बहुत महत्वपूर्ण है कि प्रत्येक कंपनी किस विचारधारा के साथ अपने मॉडल और API का निर्माण कर रही है।&lt;/p>
&lt;h3 id="11-openai-chatgpt">1.1 OpenAI (ChatGPT)
&lt;/h3>&lt;p>OpenAI का मिशन &amp;ldquo;कृत्रिम सामान्य बुद्धिमत्ता (AGI) की प्राप्ति&amp;rdquo; है, और यह हमेशा उद्योग में वास्तविक मानक (de facto standard) का नेतृत्व करता है। यह विभिन्न उपयोग मामलों के अनुकूल कई मॉडल प्रदान करता है, जैसे कि GPT-4o, GPT-4o-mini, और तर्क-विशिष्ट o1 मॉडल। इसका इकोसिस्टम सबसे परिपक्व है, और आधिकारिक या अनौपचारिक रूप से इसके पास सबसे प्रचुर पुस्तकालय (libraries) और दस्तावेज़ीकरण हैं।&lt;/p>
&lt;h3 id="12-google-gemini">1.2 Google (Gemini)
&lt;/h3>&lt;p>Google ने &amp;ldquo;AI First&amp;rdquo; को अपनाया है, और इसके बुनियादी ढांचे (TPU नेटवर्क) का अधिकतम उपयोग करने वाली स्केलेबिलिटी इसकी प्रमुख ताकत है। Gemini 1.5 Pro/Flash की सबसे बड़ी विशेषता इसकी 2 मिलियन टोकन की विशाल कॉन्टेक्स्ट विंडो (context window) है, जो लंबे दस्तावेज़ों और कई घंटों के वीडियो और ऑडियो को एक साथ संसाधित करने की अनुमति देती है। Google Cloud (Vertex AI) के साथ इसका मजबूत एकीकरण भी उद्यमों के लिए आकर्षक है।&lt;/p>
&lt;h3 id="13-anthropic-claude">1.3 Anthropic (Claude)
&lt;/h3>&lt;p>Anthropic की स्थापना OpenAI के पूर्व सदस्यों द्वारा की गई थी और यह &amp;ldquo;Constitutional AI&amp;rdquo; (संवैधानिक AI) नामक एक अद्वितीय सुरक्षा दृष्टिकोण अपनाता है। Claude 3.5 Sonnet और Opus अपनी उच्च तर्क क्षमता, कोड जनरेशन क्षमता, और सबसे महत्वपूर्ण, &amp;ldquo;मानव जैसी प्राकृतिक बातचीत&amp;rdquo; और कम &amp;ldquo;मतिभ्रम (Hallucination)&amp;rdquo; के लिए कई डेवलपर्स से उत्साही समर्थन प्राप्त कर रहे हैं।&lt;/p>
&lt;hr>
&lt;h2 id="2-मडल-परवर-क-वनरदश-क-वसतत-तलन">2. मॉडल परिवारों के विनिर्देशों की विस्तृत तुलना
&lt;/h2>&lt;p>हम 2026 तक मुख्य मॉडलों के विनिर्देशों की तुलना कर रहे हैं।&lt;/p>
&lt;table>
&lt;thead>
&lt;tr>
&lt;th>प्रदाता&lt;/th>
&lt;th>मुख्य मॉडल&lt;/th>
&lt;th>अधिकतम कॉन्टेक्स्ट लंबाई&lt;/th>
&lt;th>प्रमुख ताकत&lt;/th>
&lt;th>अनुशंसित उपयोग के मामले&lt;/th>
&lt;/tr>
&lt;/thead>
&lt;tbody>
&lt;tr>
&lt;td>&lt;strong>OpenAI&lt;/strong>&lt;/td>
&lt;td>GPT-4o&lt;/td>
&lt;td>128K&lt;/td>
&lt;td>गति, दृश्य पहचान, ऑडियो समर्थन&lt;/td>
&lt;td>इंटरएक्टिव ऐप्स, सामान्य कार्य&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>&lt;strong>OpenAI&lt;/strong>&lt;/td>
&lt;td>o1-preview&lt;/td>
&lt;td>128K&lt;/td>
&lt;td>उन्नत तार्किक तर्क, गणित, कोडिंग&lt;/td>
&lt;td>जटिल एल्गोरिदम निर्माण, अनुसंधान उपयोग&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>&lt;strong>Google&lt;/strong>&lt;/td>
&lt;td>Gemini 1.5 Pro&lt;/td>
&lt;td>2,000K&lt;/td>
&lt;td>अति-लंबे पाठ प्रसंस्करण, मल्टीमॉडल (वीडियो/ऑडियो)&lt;/td>
&lt;td>विशाल कोडबेस विश्लेषण, वीडियो सारांश&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>&lt;strong>Google&lt;/strong>&lt;/td>
&lt;td>Gemini 1.5 Flash&lt;/td>
&lt;td>2,000K&lt;/td>
&lt;td>कम विलंबता, उच्च थ्रूपुट, अत्यधिक कम लागत&lt;/td>
&lt;td>रियल-टाइम प्रसंस्करण, बड़े डेटा का बैच प्रसंस्करण&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>&lt;strong>Anthropic&lt;/strong>&lt;/td>
&lt;td>Claude 3.5 Sonnet&lt;/td>
&lt;td>200K&lt;/td>
&lt;td>कोडिंग क्षमता, प्राकृतिक पाठ निर्माण&lt;/td>
&lt;td>सॉफ़्टवेयर विकास सहायता, उन्नत ग्राहक सहायता&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>&lt;strong>Anthropic&lt;/strong>&lt;/td>
&lt;td>Claude 3.5 Haiku&lt;/td>
&lt;td>200K&lt;/td>
&lt;td>अति-तेज प्रतिक्रिया, लागत प्रदर्शन&lt;/td>
&lt;td>एज (Edge) AI, रियल-टाइम चैटबॉट&lt;/td>
&lt;/tr>
&lt;/tbody>
&lt;/table>
&lt;hr>
&lt;h2 id="3-आरकटकचर-म-गहरई-स-जन-api-अनरध-क-पछ">3. आर्किटेक्चर में गहराई से जाना: API अनुरोधों के पीछे
&lt;/h2>&lt;p>जब आप LLM API को कॉल करते हैं, तो बैकएंड में किस तरह की प्रक्रिया होती है? प्रदर्शन को अनुकूलित करने के लिए इस आर्किटेक्चर को समझना आवश्यक है।&lt;/p>
&lt;p>नीचे दिया गया Mermaid आरेख API अनुरोध को क्लाइंट से भेजने से लेकर टोकन को स्ट्रीमिंग में वापस करने तक की पूरी तस्वीर दिखाता है।&lt;/p>
&lt;div class="mermaid">graph TD
A["क्लाइंट एप्लिकेशन"] -->|HTTP/REST or gRPC| B["API गेटवे"]
B --> C["लोड बैलेंसर"]
C --> D["अनुमान क्लस्टर"]
D --> E["टोकेनाइज़र (BPE / SentencePiece)"]
E --> F["KV कैश और अटेंशन मैकेनिज्म"]
F --> G["ट्रांसफॉर्मर ब्लॉक्स (फॉरवर्ड पास)"]
G --> H["आउटपुट लेयर (लॉजिट्स)"]
H --> I["सैंपलर (Temperature, Top-p, Top-k)"]
I --> J["डिटोकेनाइज़र"]
J -->|Streaming Response (Chunk)| A&lt;/div>
&lt;h3 id="31-tokenization-टकनइजशन-एलगरदम">3.1 Tokenization (टोकनाइजेशन) एल्गोरिदम
&lt;/h3>&lt;p>API में इनपुट किया गया टेक्स्ट आंतरिक रूप से &amp;ldquo;टोकन (token)&amp;rdquo; नामक इकाइयों में विभाजित हो जाता है।&lt;/p>
&lt;ul>
&lt;li>&lt;strong>OpenAI (tiktoken)&lt;/strong>: Byte-Pair Encoding (BPE) का उपयोग करता है। विशेष रूप से अंग्रेजी में यह अत्यंत कुशलता से संपीड़ित होता है, लेकिन जापानी और हिंदी जैसी गैर-वर्णमाला भाषाओं में टोकन की संख्या बढ़ने की प्रवृत्ति होती है।&lt;/li>
&lt;li>&lt;strong>Google (Gemini)&lt;/strong>: SentencePiece (Unigram Language Model) को अपनाता है। यह बहुभाषी (multilingual) समर्थन में मजबूत है, और जापानी व हिंदी जैसे टेक्स्ट को अपेक्षाकृत कम टोकन के साथ व्यक्त करने की प्रवृत्ति रखता है।&lt;/li>
&lt;li>&lt;strong>Anthropic (Claude)&lt;/strong>: BPE के एक अनुकूलित संस्करण का उपयोग करता है। बहुभाषी समर्थन को मजबूत किया गया है, और Claude 3 के बाद से गैर-अंग्रेजी भाषाओं (जैसे जापानी) की टोकन दक्षता में काफी सुधार हुआ है।&lt;/li>
&lt;/ul>
&lt;hr>
&lt;h2 id="4-वलबत-latency-और-परदरशन-क-गणतय-वशलषण">4. विलंबता (Latency) और प्रदर्शन का गणितीय विश्लेषण
&lt;/h2>&lt;p>रियल-टाइम एप्लिकेशन में, विलंबता सीधे उपयोगकर्ता अनुभव (UX) को प्रभावित करती है। LLM API की विलंबता $T_{total}$ को गणितीय रूप से निम्न प्रकार मॉडल किया जा सकता है:&lt;/p>
$$ T_{total} = T_{network} + T_{TTFT} + (N \times T_{TPOT}) $$
&lt;p>यहाँ, प्रत्येक चर (variable) का अर्थ निम्नलिखित है:&lt;/p>
&lt;ul>
&lt;li>$T_{network}$: नेटवर्क का राउंड ट्रिप टाइम (RTT)।&lt;/li>
&lt;li>$T_{TTFT}$ (Time To First Token): पहला अक्षर उत्पन्न होने में लगने वाला समय। यह काफी हद तक अटेंशन (Attention) गणना की लागत पर निर्भर करता है, जो प्रॉम्प्ट की लंबाई (इनपुट टोकन की संख्या) के वर्ग (square) के समानुपाती (proportional) होता है।&lt;/li>
&lt;li>$N$: आउटपुट टोकन की कुल संख्या।&lt;/li>
&lt;li>$T_{TPOT}$ (Time Per Output Token): प्रति टोकन जनरेशन का समय। चूँकि यह एक ऑटो-रिग्रेसिव (auto-regressive) मॉडल है, इसकी गणना पिछले आउटपुट के आधार पर क्रमिक रूप से (in series) की जाती है।&lt;/li>
&lt;/ul>
&lt;h3 id="41-सलफ-अटशन-self-attention-ततर-क-कमपयटशनल-जटलत">4.1 सेल्फ-अटेंशन (Self-Attention) तंत्र की कम्प्यूटेशनल जटिलता
&lt;/h3>&lt;p>Transformer आर्किटेक्चर में सेल्फ-अटेंशन की गणना जटिलता इनपुट अनुक्रम की लंबाई $L$ के संबंध में द्विघातीय रूप से (quadratically) बढ़ती है।&lt;/p>
$$ \text{Complexity} = O(L^2 \cdot d) $$
&lt;p>जहाँ $d$ एम्बेडिंग वेक्टर का आयाम (dimension) है। इस सीमा के कारण, आमतौर पर जैसे-जैसे प्रॉम्प्ट लंबा होता जाता है, $T_{TTFT}$ तेजी से खराब होता है।
हालाँकि, Google का Gemini 1.5 &amp;ldquo;Ring Attention&amp;rdquo; और &amp;ldquo;Block-wise Compute&amp;rdquo; जैसे अभिनव अनुकूलन आर्किटेक्चर को अपनाता है, जो 2 मिलियन टोकन के लंबे पाठ इनपुट के साथ भी व्यावहारिक समय (कुछ सेकंड से लेकर कई दहाई सेकंड) में पहला टोकन सफलतापूर्वक उत्पन्न कर सकता है।&lt;/p>
&lt;hr>
&lt;h2 id="5-मलय-नरधरण-परणल-और-लगत-अनकलन-रणनतय">5. मूल्य निर्धारण प्रणाली और लागत अनुकूलन रणनीतियाँ
&lt;/h2>&lt;p>API की लागत मूल रूप से इनपुट टोकन और आउटपुट टोकन की संख्या के आधार पर गणना की जाती है।&lt;/p>
$$ Cost = (Tokens_{in} \times Rate_{in}) + (Tokens_{out} \times Rate_{out}) $$
&lt;p>हालाँकि, नवीनतम APIs ने लागत को काफी कम करने के लिए नए तंत्र पेश किए हैं।&lt;/p>
&lt;h3 id="51-परमपट-कशग-prompt-caching">5.1 प्रॉम्प्ट कैशिंग (Prompt Caching)
&lt;/h3>&lt;p>विशाल सिस्टम प्रॉम्प्ट या RAG के माध्यम से खोजे गए बड़ी मात्रा में दस्तावेज़ों को हर बार भेजने से भारी लागत आती है। इससे निपटने के लिए, प्रत्येक कंपनी कैशिंग कार्यक्षमता प्रदान कर रही है।&lt;/p>
&lt;p>Anthropic (Claude) और Google (Gemini) विशिष्ट टेक्स्ट ब्लॉक को कैश करके इनपुट लागत को काफी कम (90% तक) कर सकते हैं।&lt;/p>
&lt;p>कैश का उपयोग करते समय लागत मॉडल कुछ इस प्रकार होता है:&lt;/p>
$$ Cost_{cached} = (Tokens_{cache\_write} \times Rate_{cache\_write}) + (Tokens_{cache\_read} \times Rate_{cache\_read}) + (Tokens_{out} \times Rate_{out}) $$
&lt;p>यहाँ $Rate_{cache\_read}$ आम तौर पर नियमित $Rate_{in}$ के 10% से 25% पर सेट होता है। इसके परिणामस्वरूप, पृष्ठभूमि ज्ञान के रूप में कोडबेस की हज़ारों पंक्तियों को बनाए रखते हुए चैटबॉट्स को सस्ते में चलाना संभव हो गया है।&lt;/p>
&lt;h3 id="52-बच-api-batch-api">5.2 बैच API (Batch API)
&lt;/h3>&lt;p>ऐसे कार्यों के लिए जिन्हें रीयल-टाइम प्रोसेसिंग की आवश्यकता नहीं है (लॉग विश्लेषण, भारी डेटा वर्गीकरण, आदि), OpenAI और Anthropic बैच API प्रदान करते हैं। आप 24 घंटे के भीतर परिणाम प्राप्त करने के बदले में, एक ही बार में कई अनुरोध भेज सकते हैं और इसका उपयोग नियमित API शुल्क के आधे (50% की छूट) पर कर सकते हैं। यह एक बहुत शक्तिशाली तंत्र है।&lt;/p>
&lt;hr>
&lt;h2 id="6-डवलपर-अनभव-dx-और-sdk-क-तलन">6. डेवलपर अनुभव (DX) और SDK की तुलना
&lt;/h2>&lt;p>विकास दक्षता के नजरिए से, हम प्रत्येक कंपनी द्वारा प्रदान किए जाने वाले SDK (सॉफ़्टवेयर डेवलपमेंट किट) की तुलना करेंगे।&lt;/p>
&lt;h3 id="61-openai-api">6.1 OpenAI API
&lt;/h3>&lt;p>यह सबसे व्यापक रूप से उपयोग किया जाता है, और थर्ड-पार्टी लाइब्रेरी (जैसे LangChain, LlamaIndex) का समर्थन सबसे तेज है। इसके अतिरिक्त, इसकी &amp;ldquo;Structured Outputs&amp;rdquo; विशेषता के माध्यम से, यह 100% सटीकता के साथ JSON स्कीमा का पालन करने वाली प्रतिक्रियाएं लौटाने की गारंटी देता है, जिससे सिस्टम एकीकरण बहुत आसान हो जाता है।&lt;/p>
&lt;h3 id="62-anthropic-api-claude">6.2 Anthropic API (Claude)
&lt;/h3>&lt;p>SDK का इंटरफ़ेस बहुत परिष्कृत (refined) है, और TypeScript प्रकार (type definitions) परिभाषाओं को संभालना बहुत आसान माना जाता है। विशेष रूप से, इसका Message API संरचना काफी सहज है, और कई छवियों सहित मल्टीमॉडल अनुरोधों को सरलता से लिखा जा सकता है।&lt;/p>
&lt;h3 id="63-google-gemini-api">6.3 Google Gemini API
&lt;/h3>&lt;p>यहाँ पहुँच के दो तरीके हैं: Google Cloud Vertex AI के माध्यम से और AI Studio (Google Gen AI SDK) के माध्यम से, जो शुरुआती लोगों को थोड़ा भ्रमित कर सकता है। हालाँकि, उद्यमों के लिए Vertex AI SDK, GCP के IAM (पहचान और पहुँच प्रबंधन प्रणाली) के साथ पूरी तरह से एकीकृत है और एक सुरक्षित विकास वातावरण बनाने में सक्षम है।&lt;/p>
&lt;hr>
&lt;h2 id="7-अभयस-python-क-उपयग-करक-बह-api-एककरण-परकषण-क-करयनवयन">7. अभ्यास! Python का उपयोग करके बहु-API एकीकरण परीक्षण का कार्यान्वयन
&lt;/h2>&lt;p>यहाँ, हम एक ऐसी स्क्रिप्ट लागू करेंगे जो एक साथ OpenAI, Anthropic और Gemini API को अतुल्यकालिक (asynchronous) रूप से अनुरोध भेजती है और Python का उपयोग करके विलंबता (latency) की तुलना करती है।&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;span class="lnt">14
&lt;/span>&lt;span class="lnt">15
&lt;/span>&lt;span class="lnt">16
&lt;/span>&lt;span class="lnt">17
&lt;/span>&lt;span class="lnt">18
&lt;/span>&lt;span class="lnt">19
&lt;/span>&lt;span class="lnt">20
&lt;/span>&lt;span class="lnt">21
&lt;/span>&lt;span class="lnt">22
&lt;/span>&lt;span class="lnt">23
&lt;/span>&lt;span class="lnt">24
&lt;/span>&lt;span class="lnt">25
&lt;/span>&lt;span class="lnt">26
&lt;/span>&lt;span class="lnt">27
&lt;/span>&lt;span class="lnt">28
&lt;/span>&lt;span class="lnt">29
&lt;/span>&lt;span class="lnt">30
&lt;/span>&lt;span class="lnt">31
&lt;/span>&lt;span class="lnt">32
&lt;/span>&lt;span class="lnt">33
&lt;/span>&lt;span class="lnt">34
&lt;/span>&lt;span class="lnt">35
&lt;/span>&lt;span class="lnt">36
&lt;/span>&lt;span class="lnt">37
&lt;/span>&lt;span class="lnt">38
&lt;/span>&lt;span class="lnt">39
&lt;/span>&lt;span class="lnt">40
&lt;/span>&lt;span class="lnt">41
&lt;/span>&lt;span class="lnt">42
&lt;/span>&lt;span class="lnt">43
&lt;/span>&lt;span class="lnt">44
&lt;/span>&lt;span class="lnt">45
&lt;/span>&lt;span class="lnt">46
&lt;/span>&lt;span class="lnt">47
&lt;/span>&lt;span class="lnt">48
&lt;/span>&lt;span class="lnt">49
&lt;/span>&lt;span class="lnt">50
&lt;/span>&lt;span class="lnt">51
&lt;/span>&lt;span class="lnt">52
&lt;/span>&lt;span class="lnt">53
&lt;/span>&lt;span class="lnt">54
&lt;/span>&lt;span class="lnt">55
&lt;/span>&lt;span class="lnt">56
&lt;/span>&lt;span class="lnt">57
&lt;/span>&lt;span class="lnt">58
&lt;/span>&lt;span class="lnt">59
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-python" data-lang="python">&lt;span class="line">&lt;span class="cl">&lt;span class="kn">import&lt;/span> &lt;span class="nn">asyncio&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="kn">import&lt;/span> &lt;span class="nn">time&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="kn">import&lt;/span> &lt;span class="nn">os&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="kn">from&lt;/span> &lt;span class="nn">openai&lt;/span> &lt;span class="kn">import&lt;/span> &lt;span class="n">AsyncOpenAI&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="kn">from&lt;/span> &lt;span class="nn">anthropic&lt;/span> &lt;span class="kn">import&lt;/span> &lt;span class="n">AsyncAnthropic&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="kn">import&lt;/span> &lt;span class="nn">google.generativeai&lt;/span> &lt;span class="k">as&lt;/span> &lt;span class="nn">genai&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># क्लाइंट इनिशियलाइज़ेशन&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">openai_client&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="n">AsyncOpenAI&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="n">api_key&lt;/span>&lt;span class="o">=&lt;/span>&lt;span class="n">os&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">environ&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">get&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="s2">&amp;#34;OPENAI_API_KEY&amp;#34;&lt;/span>&lt;span class="p">))&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">anthropic_client&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="n">AsyncAnthropic&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="n">api_key&lt;/span>&lt;span class="o">=&lt;/span>&lt;span class="n">os&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">environ&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">get&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="s2">&amp;#34;ANTHROPIC_API_KEY&amp;#34;&lt;/span>&lt;span class="p">))&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">genai&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">configure&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="n">api_key&lt;/span>&lt;span class="o">=&lt;/span>&lt;span class="n">os&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">environ&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">get&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="s2">&amp;#34;GEMINI_API_KEY&amp;#34;&lt;/span>&lt;span class="p">))&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">prompt&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="s2">&amp;#34;क्वांटम कंप्यूटिंग के मूल सिद्धांतों और वर्तमान क्रिप्टोग्राफी पर इसके प्रभाव को शुरुआती लोगों के लिए सरल भाषा में समझाएं।&amp;#34;&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="k">async&lt;/span> &lt;span class="k">def&lt;/span> &lt;span class="nf">fetch_openai&lt;/span>&lt;span class="p">():&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">start_time&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="n">time&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">time&lt;/span>&lt;span class="p">()&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">response&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="k">await&lt;/span> &lt;span class="n">openai_client&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">chat&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">completions&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">create&lt;/span>&lt;span class="p">(&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">model&lt;/span>&lt;span class="o">=&lt;/span>&lt;span class="s2">&amp;#34;gpt-4o&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">messages&lt;/span>&lt;span class="o">=&lt;/span>&lt;span class="p">[{&lt;/span>&lt;span class="s2">&amp;#34;role&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;user&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="s2">&amp;#34;content&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="n">prompt&lt;/span>&lt;span class="p">}],&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">max_tokens&lt;/span>&lt;span class="o">=&lt;/span>&lt;span class="mi">1024&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">elapsed&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="n">time&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">time&lt;/span>&lt;span class="p">()&lt;/span> &lt;span class="o">-&lt;/span> &lt;span class="n">start_time&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="k">return&lt;/span> &lt;span class="s2">&amp;#34;OpenAI (GPT-4o)&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">elapsed&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">response&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">choices&lt;/span>&lt;span class="p">[&lt;/span>&lt;span class="mi">0&lt;/span>&lt;span class="p">]&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">message&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">content&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="k">async&lt;/span> &lt;span class="k">def&lt;/span> &lt;span class="nf">fetch_anthropic&lt;/span>&lt;span class="p">():&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">start_time&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="n">time&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">time&lt;/span>&lt;span class="p">()&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">response&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="k">await&lt;/span> &lt;span class="n">anthropic_client&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">messages&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">create&lt;/span>&lt;span class="p">(&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">model&lt;/span>&lt;span class="o">=&lt;/span>&lt;span class="s2">&amp;#34;claude-3-5-sonnet-20240620&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">messages&lt;/span>&lt;span class="o">=&lt;/span>&lt;span class="p">[{&lt;/span>&lt;span class="s2">&amp;#34;role&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;user&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="s2">&amp;#34;content&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="n">prompt&lt;/span>&lt;span class="p">}],&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">max_tokens&lt;/span>&lt;span class="o">=&lt;/span>&lt;span class="mi">1024&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">elapsed&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="n">time&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">time&lt;/span>&lt;span class="p">()&lt;/span> &lt;span class="o">-&lt;/span> &lt;span class="n">start_time&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="k">return&lt;/span> &lt;span class="s2">&amp;#34;Anthropic (Claude 3.5 Sonnet)&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">elapsed&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">response&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">content&lt;/span>&lt;span class="p">[&lt;/span>&lt;span class="mi">0&lt;/span>&lt;span class="p">]&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">text&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="k">async&lt;/span> &lt;span class="k">def&lt;/span> &lt;span class="nf">fetch_gemini&lt;/span>&lt;span class="p">():&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">start_time&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="n">time&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">time&lt;/span>&lt;span class="p">()&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">model&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="n">genai&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">GenerativeModel&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="s1">&amp;#39;gemini-1.5-pro&amp;#39;&lt;/span>&lt;span class="p">)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="c1"># Gemini Python SDK के एसिंक्रोनस (asynchronous) मेथड का उपयोग&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">response&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="k">await&lt;/span> &lt;span class="n">model&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">generate_content_async&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="n">prompt&lt;/span>&lt;span class="p">)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">elapsed&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="n">time&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">time&lt;/span>&lt;span class="p">()&lt;/span> &lt;span class="o">-&lt;/span> &lt;span class="n">start_time&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="k">return&lt;/span> &lt;span class="s2">&amp;#34;Google (Gemini 1.5 Pro)&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">elapsed&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">response&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">text&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="k">async&lt;/span> &lt;span class="k">def&lt;/span> &lt;span class="nf">main&lt;/span>&lt;span class="p">():&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nb">print&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="s2">&amp;#34;प्रत्येक LLM API को अनुरोध भेजे जा रहे हैं...&amp;#34;&lt;/span>&lt;span class="p">)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="c1"># 3 APIs को समानांतर (parallel) रूप से चलाएं&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">results&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="k">await&lt;/span> &lt;span class="n">asyncio&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">gather&lt;/span>&lt;span class="p">(&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">fetch_openai&lt;/span>&lt;span class="p">(),&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">fetch_anthropic&lt;/span>&lt;span class="p">(),&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">fetch_gemini&lt;/span>&lt;span class="p">()&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="k">for&lt;/span> &lt;span class="n">provider&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">latency&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="n">text&lt;/span> &lt;span class="ow">in&lt;/span> &lt;span class="n">results&lt;/span>&lt;span class="p">:&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nb">print&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="sa">f&lt;/span>&lt;span class="s2">&amp;#34;--- &lt;/span>&lt;span class="si">{&lt;/span>&lt;span class="n">provider&lt;/span>&lt;span class="si">}&lt;/span>&lt;span class="s2"> ---&amp;#34;&lt;/span>&lt;span class="p">)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nb">print&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="sa">f&lt;/span>&lt;span class="s2">&amp;#34;Latency: &lt;/span>&lt;span class="si">{&lt;/span>&lt;span class="n">latency&lt;/span>&lt;span class="si">:&lt;/span>&lt;span class="s2">.2f&lt;/span>&lt;span class="si">}&lt;/span>&lt;span class="s2"> seconds&amp;#34;&lt;/span>&lt;span class="p">)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nb">print&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="sa">f&lt;/span>&lt;span class="s2">&amp;#34;Response (Excerpt): &lt;/span>&lt;span class="si">{&lt;/span>&lt;span class="n">text&lt;/span>&lt;span class="p">[:&lt;/span>&lt;span class="mi">100&lt;/span>&lt;span class="p">]&lt;/span>&lt;span class="si">}&lt;/span>&lt;span class="s2">...&lt;/span>&lt;span class="se">\n&lt;/span>&lt;span class="s2">&amp;#34;&lt;/span>&lt;span class="p">)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="k">if&lt;/span> &lt;span class="vm">__name__&lt;/span> &lt;span class="o">==&lt;/span> &lt;span class="s2">&amp;#34;__main__&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="n">asyncio&lt;/span>&lt;span class="o">.&lt;/span>&lt;span class="n">run&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="n">main&lt;/span>&lt;span class="p">())&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>इस स्क्रिप्ट को चलाकर, आप आसानी से माप सकते हैं कि वास्तविक नेटवर्क वातावरण में कौन सा मॉडल सबसे तेज़ी से ($T_{total}$ को कम करके) प्रतिक्रिया देता है।&lt;/p>
&lt;hr>
&lt;h2 id="8-nodejs-क-सथ-टल-कलग-function-calling-क-करयनवयन">8. Node.js के साथ टूल कॉलिंग (Function Calling) का कार्यान्वयन
&lt;/h2>&lt;p>LLM को केवल एक चैटबॉट के रूप में काम करने के बजाय बाहरी प्रणालियों के साथ जुड़ने वाले &amp;ldquo;AI एजेंट&amp;rdquo; के रूप में कार्य करने के लिए, टूल कॉलिंग (या फंक्शन कॉलिंग) आवश्यक है। नीचे Node.js (TypeScript) का उपयोग करके OpenAI API के माध्यम से मौसम API को कॉल करने का एक उदाहरण दिया गया है।&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;span class="lnt">14
&lt;/span>&lt;span class="lnt">15
&lt;/span>&lt;span class="lnt">16
&lt;/span>&lt;span class="lnt">17
&lt;/span>&lt;span class="lnt">18
&lt;/span>&lt;span class="lnt">19
&lt;/span>&lt;span class="lnt">20
&lt;/span>&lt;span class="lnt">21
&lt;/span>&lt;span class="lnt">22
&lt;/span>&lt;span class="lnt">23
&lt;/span>&lt;span class="lnt">24
&lt;/span>&lt;span class="lnt">25
&lt;/span>&lt;span class="lnt">26
&lt;/span>&lt;span class="lnt">27
&lt;/span>&lt;span class="lnt">28
&lt;/span>&lt;span class="lnt">29
&lt;/span>&lt;span class="lnt">30
&lt;/span>&lt;span class="lnt">31
&lt;/span>&lt;span class="lnt">32
&lt;/span>&lt;span class="lnt">33
&lt;/span>&lt;span class="lnt">34
&lt;/span>&lt;span class="lnt">35
&lt;/span>&lt;span class="lnt">36
&lt;/span>&lt;span class="lnt">37
&lt;/span>&lt;span class="lnt">38
&lt;/span>&lt;span class="lnt">39
&lt;/span>&lt;span class="lnt">40
&lt;/span>&lt;span class="lnt">41
&lt;/span>&lt;span class="lnt">42
&lt;/span>&lt;span class="lnt">43
&lt;/span>&lt;span class="lnt">44
&lt;/span>&lt;span class="lnt">45
&lt;/span>&lt;span class="lnt">46
&lt;/span>&lt;span class="lnt">47
&lt;/span>&lt;span class="lnt">48
&lt;/span>&lt;span class="lnt">49
&lt;/span>&lt;span class="lnt">50
&lt;/span>&lt;span class="lnt">51
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-typescript" data-lang="typescript">&lt;span class="line">&lt;span class="cl">&lt;span class="kr">import&lt;/span> &lt;span class="nx">OpenAI&lt;/span> &lt;span class="kr">from&lt;/span> &lt;span class="s2">&amp;#34;openai&amp;#34;&lt;/span>&lt;span class="p">;&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="kr">const&lt;/span> &lt;span class="nx">openai&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="k">new&lt;/span> &lt;span class="nx">OpenAI&lt;/span>&lt;span class="p">({&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nx">apiKey&lt;/span>: &lt;span class="kt">process.env.OPENAI_API_KEY&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="p">});&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="kr">async&lt;/span> &lt;span class="kd">function&lt;/span> &lt;span class="nx">runAgent() {&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="kr">const&lt;/span> &lt;span class="nx">tools&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="p">[&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">{&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="kr">type&lt;/span>&lt;span class="o">:&lt;/span> &lt;span class="s2">&amp;#34;function&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="kd">function&lt;/span>&lt;span class="o">:&lt;/span> &lt;span class="p">{&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nx">name&lt;/span>&lt;span class="o">:&lt;/span> &lt;span class="s2">&amp;#34;get_weather&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nx">description&lt;/span>&lt;span class="o">:&lt;/span> &lt;span class="s2">&amp;#34;निर्दिष्ट शहर का वर्तमान मौसम प्राप्त करता है।&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nx">parameters&lt;/span>&lt;span class="o">:&lt;/span> &lt;span class="p">{&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="kr">type&lt;/span>&lt;span class="o">:&lt;/span> &lt;span class="s2">&amp;#34;object&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nx">properties&lt;/span>&lt;span class="o">:&lt;/span> &lt;span class="p">{&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nx">location&lt;/span>&lt;span class="o">:&lt;/span> &lt;span class="p">{&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="kr">type&lt;/span>&lt;span class="o">:&lt;/span> &lt;span class="s2">&amp;#34;string&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nx">description&lt;/span>&lt;span class="o">:&lt;/span> &lt;span class="s2">&amp;#34;शहर का नाम (उदाहरण: टोक्यो, न्यूयॉर्क)&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">},&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">},&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nx">required&lt;/span>&lt;span class="o">:&lt;/span> &lt;span class="p">[&lt;/span>&lt;span class="s2">&amp;#34;location&amp;#34;&lt;/span>&lt;span class="p">],&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">},&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">},&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">},&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">];&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="kr">const&lt;/span> &lt;span class="nx">response&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="k">await&lt;/span> &lt;span class="nx">openai&lt;/span>&lt;span class="p">.&lt;/span>&lt;span class="nx">chat&lt;/span>&lt;span class="p">.&lt;/span>&lt;span class="nx">completions&lt;/span>&lt;span class="p">.&lt;/span>&lt;span class="nx">create&lt;/span>&lt;span class="p">({&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nx">model&lt;/span>&lt;span class="o">:&lt;/span> &lt;span class="s2">&amp;#34;gpt-4o&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nx">messages&lt;/span>&lt;span class="o">:&lt;/span> &lt;span class="p">[{&lt;/span> &lt;span class="nx">role&lt;/span>&lt;span class="o">:&lt;/span> &lt;span class="s2">&amp;#34;user&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span> &lt;span class="s2">&amp;#34;content&amp;#34;&lt;/span>&lt;span class="o">:&lt;/span> &lt;span class="s2">&amp;#34;आज टोक्यो का मौसम कैसा है? क्या मुझे छाते की ज़रूरत पड़ेगी?&amp;#34;&lt;/span> &lt;span class="p">}],&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nx">tools&lt;/span>: &lt;span class="kt">tools&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nx">tool_choice&lt;/span>&lt;span class="o">:&lt;/span> &lt;span class="s2">&amp;#34;auto&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">});&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="kr">const&lt;/span> &lt;span class="nx">message&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="nx">response&lt;/span>&lt;span class="p">.&lt;/span>&lt;span class="nx">choices&lt;/span>&lt;span class="p">[&lt;/span>&lt;span class="mi">0&lt;/span>&lt;span class="p">].&lt;/span>&lt;span class="nx">message&lt;/span>&lt;span class="p">;&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="k">if&lt;/span> &lt;span class="p">(&lt;/span>&lt;span class="nx">message&lt;/span>&lt;span class="p">.&lt;/span>&lt;span class="nx">tool_calls&lt;/span>&lt;span class="p">)&lt;/span> &lt;span class="p">{&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="kr">const&lt;/span> &lt;span class="nx">toolCall&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="nx">message&lt;/span>&lt;span class="p">.&lt;/span>&lt;span class="nx">tool_calls&lt;/span>&lt;span class="p">[&lt;/span>&lt;span class="mi">0&lt;/span>&lt;span class="p">];&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nx">console&lt;/span>&lt;span class="p">.&lt;/span>&lt;span class="nx">log&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="sb">`LLM ने टूल कॉल का अनुरोध किया है: फ़ंक्शन का नाम = &lt;/span>&lt;span class="si">${&lt;/span>&lt;span class="nx">toolCall&lt;/span>&lt;span class="p">.&lt;/span>&lt;span class="kd">function&lt;/span>&lt;span class="p">.&lt;/span>&lt;span class="nx">name&lt;/span>&lt;span class="si">}&lt;/span>&lt;span class="sb">`&lt;/span>&lt;span class="p">);&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="kr">const&lt;/span> &lt;span class="nx">args&lt;/span> &lt;span class="o">=&lt;/span> &lt;span class="nx">JSON&lt;/span>&lt;span class="p">.&lt;/span>&lt;span class="nx">parse&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="nx">toolCall&lt;/span>&lt;span class="p">.&lt;/span>&lt;span class="kd">function&lt;/span>&lt;span class="p">.&lt;/span>&lt;span class="nx">arguments&lt;/span>&lt;span class="p">);&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nx">console&lt;/span>&lt;span class="p">.&lt;/span>&lt;span class="nx">log&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="sb">`आर्गुमेंट: &lt;/span>&lt;span class="si">${&lt;/span>&lt;span class="nx">args&lt;/span>&lt;span class="p">.&lt;/span>&lt;span class="nx">location&lt;/span>&lt;span class="si">}&lt;/span>&lt;span class="sb">`&lt;/span>&lt;span class="p">);&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="c1">// यहाँ वास्तविक मौसम API (उदा: OpenWeatherMap) को कॉल करने का लॉजिक लागू करें
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1">&lt;/span> &lt;span class="c1">// const weather = await fetchWeatherFromAPI(args.location);
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1">&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="c1">// अंतिम उत्तर उत्पन्न करने के लिए प्राप्त परिणाम को वापस LLM को दें
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1">&lt;/span> &lt;span class="p">}&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="p">}&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="nx">runAgent&lt;/span>&lt;span class="p">().&lt;/span>&lt;span class="k">catch&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="nx">console&lt;/span>&lt;span class="p">.&lt;/span>&lt;span class="nx">error&lt;/span>&lt;span class="p">);&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Claude 3.5 Sonnet और Gemini 1.5 Pro में भी समतुल्य टूल कॉलिंग कार्यक्षमता है। हालांकि स्कीमा को परिभाषित करने के तरीके में कुछ अंतर हैं, फिर भी बुनियादी प्रवाह (flow) समान है।&lt;/p>
&lt;hr>
&lt;h2 id="9-rag-बनम-लब-कनटकसट-वड-आपक-कस-चनन-चहए">9. RAG बनाम लंबी कॉन्टेक्स्ट विंडो: आपको किसे चुनना चाहिए?
&lt;/h2>&lt;p>वर्तमान में, एंटरप्राइज़ AI आर्किटेक्चर में सबसे बड़ी बहसों में से एक यह है: &amp;ldquo;बाहरी ज्ञान को शामिल करने के लिए, क्या हमें RAG (Retrieval-Augmented Generation) का उपयोग करना चाहिए, या सब कुछ एक विशाल कॉन्टेक्स्ट विंडो (Long Context) पर छोड़ देना चाहिए?&amp;rdquo;&lt;/p>
&lt;h3 id="rag-retrieval-augmented-generation-क-लभ-और-चनतय">RAG (Retrieval-Augmented Generation) के लाभ और चुनौतियाँ
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>लाभ&lt;/strong>: यह सस्ता है (क्योंकि केवल आवश्यक चंक्स प्रॉम्प्ट में डाले जाते हैं), और उत्तर के आधार (स्रोत) की पहचान करना आसान है।&lt;/li>
&lt;li>&lt;strong>चुनौतियाँ&lt;/strong>: यह सिमेंटिक सर्च की सटीकता पर निर्भर करता है, इसलिए यह उन्नत तर्क कार्यों के लिए उपयुक्त नहीं है जहाँ संदर्भ कई दस्तावेज़ों में फैला हुआ हो (जैसे, &amp;ldquo;पिछले साल के सभी मीटिंग मिनट्स का विश्लेषण करें और प्रोजेक्ट A के विलंबित होने का मूल कारण कालानुक्रमिक क्रम (chronological order) में निकालें&amp;rdquo;)।&lt;/li>
&lt;/ul>
&lt;h3 id="लब-कनटकसट-long-context-उदहरण-gemini-15-pro-क-2-मलयन-टकन">लंबा कॉन्टेक्स्ट (Long Context, उदाहरण: Gemini 1.5 Pro का 2 मिलियन टोकन)
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>लाभ&lt;/strong>: खोज के कारण कोई जानकारी छूटती नहीं है। यहां तक ​​कि &amp;ldquo;Needle In A Haystack (NIAH)&amp;rdquo; परीक्षण में भी, Gemini 1.5 Pro और Claude 3.5 Sonnet 99% से अधिक सटीकता के साथ जानकारी निकाल सकते हैं।&lt;/li>
&lt;li>&lt;strong>चुनौतियाँ&lt;/strong>: भारी टोकन खपत से लागत बढ़ती है, और विलंबता ($T_{TTFT}$) बढ़ जाती है।&lt;/li>
&lt;/ul>
&lt;p>&lt;strong>निष्कर्ष&lt;/strong>: 2026 में सबसे अच्छी रणनीति &lt;strong>&amp;ldquo;हाइब्रिड अप्रोच&amp;rdquo;&lt;/strong> है। नियमित Q&amp;amp;A के लिए वेक्टर डेटाबेस का उपयोग करते हुए RAG का उपयोग करना, और विशेष कार्यों के लिए प्रॉम्प्ट कैशिंग का लाभ उठाने वाले लॉन्ग कॉन्टेक्स्ट का उपयोग करना (जहाँ जटिल विश्लेषण या पूरे कोड की समीक्षा की आवश्यकता होती है) मुख्यधारा का डिज़ाइन बन गया है।&lt;/p>
&lt;hr>
&lt;h2 id="10-मलटमडल-परससग-कषमतओ-क-तलन">10. मल्टीमॉडल प्रोसेसिंग क्षमताओं की तुलना
&lt;/h2>&lt;p>अगली पीढ़ी के AI एप्लिकेशन को केवल पाठ को ही नहीं, बल्कि छवियों, ऑडियो और वीडियो को सीधे समझने की क्षमता की आवश्यकता होगी।&lt;/p>
&lt;div class="mermaid">sequenceDiagram
participant User as "उपयोगकर्ता"
participant Client as "फ्रंटएंड ऐप"
participant API as "LLM API (मल्टीमॉडल)"
User->>Client: Upload Video &amp; Text Prompt
Client->>API: Send Video Bytes/URI + Text
Note over API: Video chunking &amp; Audio separation
Note over API: Multimodal Embedding Model
API-->>Client: Return Text Summary &amp; Timestamps
Client-->>User: Display Insights&lt;/div>
&lt;ul>
&lt;li>&lt;strong>OpenAI (GPT-4o)&lt;/strong>: इसमें छवि पहचान की सटीकता बहुत अधिक है, और यह हस्तलिखित रेखाचित्रों (handwritten drawings) और जटिल ग्राफ़ को पढ़ने में उत्कृष्ट है। Realtime API का उपयोग करने वाला इसका अल्ट्रा-लो लेटेंसी (कुछ सौ मिलीसेकंड) नेटिव वॉयस इंटरेक्शन भी काफी शक्तिशाली है।&lt;/li>
&lt;li>&lt;strong>Google (Gemini 1.5 Pro)&lt;/strong>: &lt;strong>वीडियो विश्लेषण में यह बाकियों को पछाड़ देता है।&lt;/strong> आप 1 घंटे की वीडियो फ़ाइल (फ्रेम + ऑडियो) को सीधे इनपुट कर सकते हैं और बहुत विशिष्ट प्रश्नों का उत्तर पा सकते हैं जैसे, &amp;ldquo;12 मिनट 45 सेकंड पर स्क्रीन के दाईं ओर दिखाई देने वाले व्यक्ति के पास मौजूद दस्तावेज़ का शीर्षक क्या है?&amp;rdquo;&lt;/li>
&lt;li>&lt;strong>Anthropic (Claude 3.5 Sonnet)&lt;/strong>: छवि पहचान (Vision) क्षमता GPT-4o के समान स्तर पर बहुत उत्कृष्ट है। फ्रंट-एंड विकास सहायता में यह बेजोड़ ताकत दिखाता है, जैसे कि UI स्क्रीनशॉट प्रदान करना और यह पूछना, &amp;ldquo;इस स्क्रीन के लिए React घटक कोड उत्पन्न करें।&amp;rdquo;&lt;/li>
&lt;/ul>
&lt;hr>
&lt;h2 id="11-एटरपरइज-सतर-क-सरकष-और-अनपलन-compliance">11. एंटरप्राइज़-स्तर की सुरक्षा और अनुपालन (Compliance)
&lt;/h2>&lt;p>जब कंपनियाँ उत्पादन वातावरण (production environments) में LLM API का उपयोग करती हैं, तो सबसे बड़ी चिंताएँ होती हैं: &amp;ldquo;क्या हमारे डेटा का उपयोग AI को प्रशिक्षित करने के लिए किया जाएगा?&amp;rdquo; और &amp;ldquo;क्या यह अनुपालन आवश्यकताओं को पूरा करता है?&amp;rdquo;&lt;/p>
&lt;p>तीनों कंपनियों ने स्पष्ट रूप से कहा है कि वे मॉडल को प्रशिक्षित करने के लिए API के माध्यम से भेजे गए डेटा (प्रॉम्प्ट और प्रतिक्रियाओं) का &lt;strong>उपयोग नहीं (Zero Data Retention / No Training on Customer Data)&lt;/strong> करती हैं (※ध्यान दें कि मुफ्त उपभोक्ता-सामना (consumer-facing) वेब चैट UI के लिए नियम अलग हैं)।&lt;/p>
&lt;p>यदि सुरक्षा के और भी उच्च स्तर की आवश्यकता है:&lt;/p>
&lt;ul>
&lt;li>&lt;strong>OpenAI&lt;/strong>: Azure OpenAI Service के माध्यम से, आप Microsoft के एंटरप्राइज़-ग्रेड सुरक्षा, SLA और Azure Private Link का उपयोग करके एक निजी नेटवर्क कनेक्शन का लाभ उठा सकते हैं।&lt;/li>
&lt;li>&lt;strong>Google&lt;/strong>: Google Cloud Vertex AI के माध्यम से, आप VPC सर्विस कंट्रोल्स का उपयोग करके सख्त नेटवर्क अलगाव और CMEK (Customer-Managed Encryption Keys) के साथ डेटा सुरक्षा का उपयोग कर सकते हैं।&lt;/li>
&lt;li>&lt;strong>Anthropic&lt;/strong>: AWS Bedrock या Google Cloud Vertex AI के माध्यम से उपयोग करके, आप क्लाउड प्रदाताओं के मजबूत सुरक्षा बुनियादी ढांचे का लाभ उठा सकते हैं।&lt;/li>
&lt;/ul>
&lt;hr>
&lt;h2 id="12-नषकरष-उपयग-क-ममल-क-अनसर-अतम-चयन-मरगदरशक">12. निष्कर्ष: उपयोग के मामले के अनुसार अंतिम चयन मार्गदर्शिका
&lt;/h2>&lt;p>अब तक हमने कई दृष्टिकोणों से तुलना की है, लेकिन अंततः &amp;ldquo;हमें कौन सा चुनना चाहिए?&amp;rdquo; इस प्रश्न का निष्कर्ष आपके उपयोग के मामले (use case) पर निर्भर करता है।&lt;/p>
&lt;ol>
&lt;li>
&lt;p>&lt;strong>जटिल सॉफ़्टवेयर विकास, कोड जनरेशन, उन्नत तर्क&lt;/strong>:
&lt;strong>👑 विजेता: Claude 3.5 Sonnet (Anthropic)&lt;/strong>
यह वर्तमान में कोड के संदर्भ को समझने, रिफैक्टरिंग और स्वाभाविक, मानव जैसा पाठ लिखने में सर्वश्रेष्ठ प्रदर्शन प्रदान करता है। API की उपयोगिता और प्रॉम्प्ट कैशिंग की लागत दक्षता भी उत्कृष्ट है।&lt;/p>
&lt;/li>
&lt;li>
&lt;p>&lt;strong>अति-लंबे दस्तावेज़ों का विश्लेषण, वीडियो/ऑडियो का बैच प्रसंस्करण&lt;/strong>:
&lt;strong>👑 विजेता: Gemini 1.5 Pro (Google)&lt;/strong>
इसकी 2 मिलियन टोकन की कॉन्टेक्स्ट विंडो इसका अद्वितीय हथियार है। उन कार्यों के लिए जहाँ आपको पूरे डेटा की समग्र तस्वीर (big picture) को समझने की आवश्यकता होती है, जैसे सैकड़ों पृष्ठों के PDF मैनुअल का विश्लेषण करना या लंबी मीटिंग रिकॉर्डिंग का सारांश देना, Gemini का कोई मुकाबला नहीं है।&lt;/p>
&lt;/li>
&lt;li>
&lt;p>&lt;strong>बहुमुखी प्रतिभा (Versatility), निष्पादन गति (Execution Speed), और स्थिर संरचित आउटपुट (JSON)&lt;/strong>:
&lt;strong>👑 विजेता: GPT-4o / GPT-4o-mini (OpenAI)&lt;/strong>
यह सभी कार्यों को सुचारू रूप से संभालता है और इसमें सबसे अधिक थर्ड-पार्टी टूल समर्थन है। जब आपको Structured Outputs का उपयोग करके विश्वसनीय JSON पार्सिंग या o1 मॉडल का उपयोग करके अति-उन्नत तार्किक तर्क की आवश्यकता होती है, तो OpenAI इकोसिस्टम अनिवार्य है।&lt;/p>
&lt;/li>
&lt;/ol>
&lt;h3 id="मलट-मडल-रउटग-क-सफरश">मल्टी-मॉडल राउटिंग की सिफारिश
&lt;/h3>&lt;p>एक ही API (वेंडर लॉक-इन) पर निर्भर रहने के बजाय, भविष्य का रुझान एक &lt;strong>&amp;ldquo;LLM राउटिंग&amp;rdquo;&lt;/strong> आर्किटेक्चर है जो कार्य की कठिनाई और महत्व के आधार पर मॉडल को गतिशील रूप से (dynamically) बदलता है।
उदाहरण के लिए, उपयोगकर्ताओं के सरल प्रश्नों का उत्तर सस्ते और तेज़ &lt;code>GPT-4o-mini&lt;/code> या &lt;code>Gemini 1.5 Flash&lt;/code> के साथ देना, और कार्य को केवल तभी &lt;code>Claude 3.5 Sonnet&lt;/code> पर वापस भेजना (fallback) जब जटिल प्रसंस्करण की आवश्यकता हो, लागत और प्रदर्शन के इष्टतम संतुलन को प्राप्त कर सकता है।&lt;/p>
&lt;p>AI का विकास रुकने वाला नहीं है। कृपया प्रत्येक API की ताकत और कमजोरियों, साथ ही साथ उनकी स्थापत्य विशेषताओं (architectural characteristics) को गहराई से समझें, और लचीले और स्केलेबल AI एप्लिकेशन का निर्माण करें।&lt;/p></description></item></channel></rss>