होम/प्राइवेट LLM

प्राइवेट LLM डिप्लॉयमेंट और ऑप्टिमाइज़ेशन

आपका मॉडल, आपका हार्डवेयर, आपकी डेटा सीमा

Velyrix ओपन-वेट फ्रंटियर मॉडलों को समर्पित GPU पर स्थापित, क्वांटाइज़, बेंचमार्क और संचालित करता है — Velyrix क्लाउड में, आपके कोलोकेशन क्षेत्र में, या आपके परिसर में पूर्णत: एयर-गैप्ड। आपको अनुबंधित थ्रूपुट, लेटेंसी और उपलब्धता सहित OpenAI-संगत एंडपॉइंट मिलता है।

मॉडल परिवार
10 समर्थित
सर्विंग इंजन
vLLM · SGLang · TensorRT-LLM
पहले टोकन तक समय
250 ms से कम लक्ष्य
डिप्लॉयमेंट
क्लाउड · कोलो · एयर-गैप्ड
API
OpenAI-संगत
स्वयं होस्ट क्यों करें

सार्वजनिक API तब तक सुविधाजनक हैं जब तक डेटा आपका न हो

विनियमित डेटा, स्वामित्व वाला सोर्स कोड, रोगी रिकॉर्ड, ट्रेड पोज़िशन और संप्रभु वर्कलोड शायद ही किसी और की इन्फ़रेंस कतार में होने चाहिए। अब फ्रंटियर गुणवत्ता के काफ़ी निकट ओपन-वेट मॉडल गंभीर वर्कलोड के लिए प्राइवेट डिप्लॉयमेंट को डिफ़ॉल्ट बना देते हैं।

  • डेटा कभी आपकी सीमा नहीं छोड़ता — कोई तृतीय-पक्ष संधारण नहीं, आपके प्रॉम्प्ट पर कोई प्रशिक्षण नहीं
  • पूर्वानुमेय इकाई अर्थशास्त्र — सफलता के साथ बढ़ने वाली प्रति-टोकन बिलिंग के बजाय निश्चित GPU लागत
  • संस्करण स्थिरता — जिस मॉडल को आपने सत्यापित किया वही आपके सर्व करने का मॉडल रहता है, जब तक आप न बदलें
  • आपके नियंत्रण में लेटेंसी — एंडपॉइंट उसी क्षेत्र में, या उसी भवन में, जहाँ एप्लिकेशन है
  • गहन अनुकूलन — LoRA अडैप्टर, डोमेन फाइन-ट्यून, कस्टम टूल स्कीमा और गार्डरेल
  • ऑडिट-योग्यता — आपके अपने SIEM में पूर्ण अनुरोध लॉगिंग, आपकी अपनी संधारण नीति के साथ
सीधा माइग्रेशन
# Before — public API
client = OpenAI(api_key="sk-...")

# After — your Velyrix private endpoint
client = OpenAI(
    base_url="https://llm.internal.acme.com/v1",
    api_key=os.environ["VELYRIX_KEY"],
)

resp = client.chat.completions.create(
    model="qwen3-235b-a22b-fp8",
    messages=[{"role": "user", "content": prompt}],
    tools=tools, stream=True,
)

# Same SDK. Same schema. Your VPC, your logs, your keys.
मॉडल कैटलॉग

दस ओपन-वेट मॉडल परिवार, डिप्लॉय और समर्थित

Velyrix हर परिवार के लिए सत्यापित सर्विंग रेसिपी, क्वांटाइज़ेशन प्रोफ़ाइल और बेंचमार्क बेसलाइन रखता है, जो नए चेकपॉइंट जारी होने पर अद्यतन होते हैं।

DeepSeek

स्पार्स MoE प्रमुख मॉडल और रीज़निंग मॉडल, जिनमें लागत-संवेदनशील सर्विंग हेतु डिस्टिल्ड डेंस वैरिएंट शामिल हैं।

MoEरीज़निंगFP8 नेटिव8×H200

Qwen

Alibaba की डेंस और MoE शृंखला, 0.6B से 235B+ तक मज़बूत बहुभाषी, कोडिंग और विज़न-लैंग्वेज वैरिएंट के साथ।

डेंस + MoEबहुभाषीVLकोडर

Llama

Meta का व्यापक रूप से अपनाया गया ओपन-वेट परिवार — इकोसिस्टम टूलिंग, अडैप्टर और मूल्यांकन हार्नेस हेतु सबसे सुरक्षित डिफ़ॉल्ट।

8B–405BMoE वैरिएंटविशाल इकोसिस्टम

OpenAI gpt-oss

OpenAI की ओपन-वेट रिलीज़, कॉन्फ़िगर करने योग्य रीज़निंग प्रयास और कम GPU पर मज़बूत टूल उपयोग वाला MoE।

120b / 20bMXFP4एजेंटिक

Mistral

कई चेकपॉइंट पर उदार लाइसेंसिंग वाले यूरोपीय मॉडल — डेंस, MoE, कोड और छोटे एज वैरिएंट।

Apache श्रेणीEU मूलकोडएज

GLM

Zhipu का द्विभाषी MoE परिवार, मज़बूत एजेंटिक व कोडिंग प्रदर्शन और हल्के air-श्रेणी चेकपॉइंट के साथ।

MoEद्विभाषीएजेंटिक

Kimi

Moonshot AI के ट्रिलियन-पैरामीटर-श्रेणी स्पार्स MoE मॉडल, लंबे संदर्भ और टूल-कॉलिंग एजेंट हेतु बने।

1T-श्रेणी MoEलंबा संदर्भएजेंट

MiniMax

प्रतिस्पर्धी सर्विंग लागत पर बहुत लंबी संदर्भ विंडो लक्षित करने वाली कुशल-अटेंशन MoE संरचनाएँ।

MoE1M संदर्भकुशल अटेंशन

Gemma

Google के हल्के ओपन मॉडल — ऑन-प्रिमाइस, एज और उच्च-मात्रा वर्गीकरण हेतु प्रति GPU उत्कृष्ट गुणवत्ता।

1B–27Bमल्टीमॉडलएज-तैयार

NVIDIA Nemotron

NVIDIA का ऑप्टिमाइज़्ड ओपन मॉडल परिवार, NVIDIA एक्सेलेरेटरों पर थ्रूपुट और एंटरप्राइज़ एजेंट वर्कफ़्लो हेतु ट्यून किया गया।

Nano / Super / UltraTensorRT-LLMNIM

मॉडल नाम उनके संबंधित स्वामियों के ट्रेडमार्क हैं। Velyrix एक स्वतंत्र इंफ्रास्ट्रक्चर प्रदाता है और इन मॉडल प्रकाशकों से संबद्ध या उनके द्वारा समर्थित नहीं है। हर मॉडल अपने स्वयं के लाइसेंस के तहत डिप्लॉय होता है, जिसकी समीक्षा हम डिप्लॉयमेंट से पहले आपके साथ करते हैं — देखें मॉडल लाइसेंसिंग.

आकार निर्धारण

हर श्रेणी के मॉडल को सर्व करने में क्या लगता है

यथार्थ समवर्तीता पर KV कैश हेतु स्थान सहित उत्पादन सर्विंग के लिए सांकेतिक एकल-प्रतिकृति आकार। अंतिम आकार आपके संदर्भ लंबाई, समवर्तीता और लेटेंसी लक्ष्यों से तय होता है।

मॉडल श्रेणीपरिशुद्धतान्यूनतम GPUअनुशंसितसंकेतात्मक थ्रूपुटमासिक इन्फ्रास्ट्रक्चर से
छोटा डेंस (1B – 9B)BF16 / FP81× L40S2× L40S / 1× H1002,500 – 6,000 टोकन/सेकंड$1,640
मध्यम डेंस (12B – 32B)FP8 / AWQ-INT41× H100 80GB2× H100 / 2× H2001,800 – 4,500 टोकन/सेकंड$3,300
बड़ा डेंस (70B – 123B)FP82× H2004× H200 / 8× H1001,400 – 3,200 टोकन/सेकंड$10,400
अति बड़ा डेंस (405B)FP88× H2008× B200900 – 2,100 टोकन/सेकंड$23,900
स्पार्स MoE (कुल 100B – 250B)FP84× H2008× H2003,000 – 9,000 टोकन/सेकंड$18,400
स्पार्स MoE (कुल 400B – 700B)FP8 / FP48× H2008× B200 / 16× H2004,000 – 14,000 टोकन/सेकंड$23,900
स्पार्स MoE (कुल 1T श्रेणी)FP8 / FP416× H2008× B300 / GB300 partition6,000 – 20,000 टोकन/सेकंड$44,800
विज़न-लैंग्वेज (कोई भी आकार)BF16 / FP8विज़न टावर हेतु +1 GPUसमर्पित एन्कोडर रेप्लिकावर्कलोड पर निर्भरकोटेशन पर

थ्रूपुट समवर्ती अनुरोधों में कुल आउटपुट टोकन प्रति सेकंड है, जो उत्पादन-प्रतिनिधि प्रॉम्प्ट के साथ Velyrix संदर्भ हार्डवेयर पर मापा गया है। आपके आँकड़े अनुबंध से पहले आपके वर्कलोड पर मापे जाते हैं, और सहमत आँकड़ा सेवा-स्तर लक्ष्य बन जाता है।

ऑप्टिमाइज़ेशन

मॉडल चलाने और उसे अच्छी तरह चलाने का अंतर

आठ GPU पर डिफ़ॉल्ट कंटेनर आमतौर पर दो से पाँच गुना थ्रूपुट छोड़ देता है। Velyrix ऑप्टिमाइज़ेशन परियोजनाएँ टोकनाइज़र से NIC तक पूरा पथ ट्यून करती हैं।

क्वांटाइज़ेशन

लाइव होने से पहले आपके अपने मूल्यांकन सेट के विरुद्ध सटीकता प्रतिगमन परीक्षण सहित FP8, NVFP4/MXFP4, AWQ, GPTQ और SmoothQuant प्रोफ़ाइल।

समांतरता रणनीति

प्रति मॉडल और GPU टोपोलॉजी के अनुसार चुने गए टेन्सर, पाइपलाइन, एक्सपर्ट और डेटा समांतर लेआउट, जिसमें MoE हेतु NVLink-सचेत एक्सपर्ट प्लेसमेंट शामिल है।

🔄

निरंतर बैचिंग

पेज्ड अटेंशन, चंक्ड प्रीफ़िल और शेड्यूलर ट्यूनिंग, ताकि आपके पहले-टोकन-तक-समय लक्ष्य का उल्लंघन किए बिना GPU व्यस्तता ऊँची रहे।

🔁

प्रीफ़िल / डिकोड पृथक्करण

KV स्थानांतरण सहित अलग प्रीफ़िल और डिकोड पूल, ताकि लंबे प्रॉम्प्ट साझा हार्डवेयर पर इंटरैक्टिव डिकोडिंग रोकना बंद करें।

🏃

स्पेकुलेटिव डिकोडिंग

आपकी स्वीकृति दर के लिए ट्यून किए गए ड्राफ़्ट मॉडल, EAGLE-शैली और n-gram स्पेकुलेशन — इंटरैक्टिव वर्कलोड पर सामान्यतः 1.5–2.5×।

💾

KV कैश इंजीनियरिंग

प्रीफ़िक्स व रेडिक्स कैशिंग, होस्ट मेमोरी या NVMe में कैश ऑफ़लोड, और अतिरिक्त GPU के बिना संदर्भ बढ़ाने हेतु क्वांटाइज़्ड KV।

📈

ऑटोस्केलिंग और रूटिंग

कैश-सचेत लोड बैलेंसिंग, कतार-गहराई ऑटोस्केलिंग और इंटरैक्टिव बनाम बैच ट्रैफ़िक हेतु प्राथमिकता श्रेणियों सहित मल्टी-रेप्लिका रूटिंग।

🧪

मूल्यांकन हार्नेस

आपका अपना गोल्डन सेट CI में जुड़ा, ताकि हर मॉडल, क्वांटाइज़ेशन या इंजन अपग्रेड केवल गति नहीं, गुणवत्ता पर परखा जाए।

🔨

इंजन चयन

प्रति वर्कलोड चुने गए vLLM, SGLang, TensorRT-LLM या NVIDIA Dynamo, प्रतिबद्धता से पहले आपके ट्रैफ़िक पर आमने-सामने बेंचमार्क किए गए।

डिप्लॉयमेंट टोपोलॉजी

अपनी डेटा सीमा खींचने के तीन तरीके

शुरू करने में सबसे तेज़

Velyrix GPU क्लाउड पर

Velyrix क्षेत्र में सिंगल-टेनेंट GPU, आपके VPC या ऑन-रैंप तक निजी नेटवर्किंग, Velyrix-संचालित स्टैक।

  • कुछ ही दिनों में लाइव
  • लचीला रेप्लिका स्केलिंग
  • Velyrix 24×7 संचालन
  • क्षेत्रीय डेटा रेज़िडेंसी
संतुलित

आपके कोलोकेशन क्षेत्र में

आपका हार्डवेयर, आपका केज, प्रबंधित सेवा समझौते के तहत Velyrix द्वारा डिप्लॉय और संचालित।

  • परिसंपत्तियाँ आपकी
  • स्टैक Velyrix चलाता है
  • कैपेक्स मॉडल
  • पूर्ण भौतिक नियंत्रण
सबसे कठोर

ऑन-प्रिमाइस और एयर-गैप्ड

ऑफ़लाइन मॉडल व कंटेनर मिरर सहित पूर्णत: विच्छेदित डिप्लॉयमेंट, और कोई आउटबाउंड टेलीमेट्री नहीं।

  • इंटरनेट पर कोई निर्भरता नहीं
  • ऑफ़लाइन रजिस्ट्री और अपडेट
  • वर्गीकृत / विनियमित हेतु तैयार
  • साइट पर हस्तांतरण प्रशिक्षण
सर्विंग से आगे

अनुकूलन, पुनर्प्राप्ति और एजेंट

  • निरंतर प्री-ट्रेनिंग उन डोमेन कॉर्पोरा पर जहाँ शब्दावली और शैली निर्देश-पालन से अधिक मायने रखती है
  • पर्यवेक्षित फाइन-ट्यूनिंग और LoRA मल्टी-अडैप्टर सर्विंग के साथ, ताकि एक बेस मॉडल दर्जनों टास्क अडैप्टर होस्ट कर सके
  • प्रेफ़रेंस ऑप्टिमाइज़ेशन — आपके अपने रेटेड डेटा पर DPO, GRPO और रिवॉर्ड-मॉडल वर्कफ़्लो
  • डिस्टिलेशन बड़े शिक्षक से छोटे छात्र तक, सर्विंग लागत को एक क्रम से घटाते हुए
  • रिट्रीवल ऑगमेंटेशन वेक्टर व हाइब्रिड सर्च, चंकिंग रणनीति, रीरैंकिंग और उद्धरण प्रवर्तन के साथ
  • एजेंट इंफ्रास्ट्रक्चर — टूल स्कीमा, संरचित आउटपुट, सैंडबॉक्स्ड निष्पादन और MCP-संगत टूल सर्वर
  • गार्डरेल — इनपुट व आउटपुट वर्गीकरण, PII रिडक्शन, जेलब्रेक पहचान और पूर्ण प्रॉम्प्ट ऑडिट लॉगिंग

मॉडल लाइसेंसिंग और शासन

ओपन वेट का अर्थ अप्रतिबंधित उपयोग नहीं है। डिप्लॉयमेंट से पहले Velyrix हर उस मॉडल का लाइसेंस देखता है जिसे आप चलाना चाहते हैं, और उसके साथ आने वाले दायित्व प्रलेखित करता है।

  • लाइसेंस वर्गीकरण — उदार, सामुदायिक या विशेष शर्तें
  • स्वीकार्य-उपयोग और उपयोग-क्षेत्र प्रतिबंध
  • श्रेय, नामकरण और पुनर्वितरण दायित्व
  • वाणिज्यिक-उपयोग सीमाएँ और व्युत्पन्न-कार्य शर्तें
  • हर चेकपॉइंट और उसके स्रोत का उद्गम रिकॉर्ड

Velyrix इंफ्रास्ट्रक्चर और इंजीनियरिंग सेवाएँ देता है और किसी तृतीय-पक्ष मॉडल में कोई अधिकार प्रदान नहीं करता। ग्राहक अपने चुने हुए मॉडलों का लाइसेंसधारी बना रहता है और उन लाइसेंसों तथा लागू AI विनियमन, जिसमें दायरे में होने पर EU AI Act शामिल है, के अनुपालन हेतु उत्तरदायी है। Velyrix उस प्रक्रिया में प्रलेखन और तकनीकी नियंत्रणों से सहयोग करता है।

अनुबंध पैकेज

प्राइवेट LLM कार्यक्रम कैसे चलता है

पायलट

2–3 सप्ताह

  • मॉडल चयन कार्यशाला
  • एकल-प्रतिकृति डिप्लॉयमेंट
  • आपके मूल्यांकन सेट के विरुद्ध बेंचमार्क
  • लागत और आकार मॉडल
  • गो / नो-गो रिपोर्ट

$27,000 से

सर्वाधिक सामान्य

उत्पादन डिप्लॉयमेंट

6–10 सप्ताह

  • मल्टी-रेप्लिका HA संरचना
  • क्वांटाइज़ेशन और इंजन ट्यूनिंग
  • गेटवे, प्रमाणीकरण, कोटा, लॉगिंग
  • गार्डरेल और मूल्यांकन CI
  • रनबुक और टीम प्रशिक्षण

$83,500 से

प्रबंधित LLM सेवा

सतत

  • 24×7 एंडपॉइंट संचालन
  • थ्रूपुट और लेटेंसी SLA
  • मॉडल और इंजन अपग्रेड
  • क्षमता और लागत रिपोर्टिंग
  • त्रैमासिक ऑप्टिमाइज़ेशन समीक्षा

$10,500 / माह से

सांकेतिक व्यावसायिक-सेवा शुल्क, GPU इंफ्रास्ट्रक्चर और कर को छोड़कर। दायरा खोज सत्र के बाद पुष्ट होता है।

AI इन्फ्रास्ट्रक्चर आर्किटेक्ट से बात करें

GPU आपके। संचालन हमारा।

अपने NVIDIA सर्वर किसी भी अधिकृत OEM या वितरक से खरीदें, उन्हें सीधे Velyrix सुविधा भेजें, और बाकी काम हम संभालते हैं — तैनाती, नेटवर्किंग, कूलिंग, निगरानी और निरंतर सहायता। या हमारे GPU किराए पर लें। दोनों ही स्थितियों में आपको एक कार्यदिवस में योजना मिलती है।

अक्सर पूछे जाने वाले प्रश्न

Velyrix हमारे लिए कौन-से LLM डिप्लॉय कर सकता है?

Velyrix दस ओपन-वेट परिवारों के लिए सत्यापित डिप्लॉयमेंट रेसिपी रखता है: DeepSeek, Qwen, Llama, OpenAI gpt-oss, Mistral, GLM, Kimi, MiniMax, Gemma और NVIDIA Nemotron, उनके विज़न-लैंग्वेज, कोडिंग और रीज़निंग वैरिएंट सहित। अन्य ओपन-वेट मॉडल अनुरोध पर जोड़े जा सकते हैं।

प्राइवेट LLM चलाने के लिए हमें कितने GPU चाहिए?

7B-9B मॉडल एक ही L40S या H100 पर सहजता से चलता है। 70B डेंस मॉडल को सामान्यतः FP8 में दो से चार H200 चाहिए। 400B-700B श्रेणी के बड़े स्पार्स MoE मॉडलों को लगभग आठ H200 या आठ B200 चाहिए, और 1T-श्रेणी मॉडल सामान्यतः B300 या GB300 विभाजनों पर सर्व किए जाते हैं। अंतिम आकार संदर्भ लंबाई, समवर्तीता और लेटेंसी लक्ष्यों पर निर्भर है।

क्या क्वांटाइज़ेशन मॉडल गुणवत्ता घटाएगा?

आधुनिक चेकपॉइंट पर FP8 सामान्यतः लगभग हानि-रहित है, और NVFP4/MXFP4 तथा 4-बिट वेट क्वांटाइज़ेशन थोड़ी गुणवत्ता के बदले बड़ा थ्रूपुट व मेमोरी लाभ देते हैं। Velyrix हमेशा आपके अपने मूल्यांकन सेट के विरुद्ध अंतर मापता है और किसी भी क्वांटाइज़्ड बिल्ड के उत्पादन में जाने से पहले उसकी रिपोर्ट देता है।

क्या डिप्लॉयमेंट पूरी तरह एयर-गैप्ड हो सकता है?

हाँ। एयर-गैप्ड डिप्लॉयमेंट ऑफ़लाइन मॉडल वेट, आंतरिक कंटेनर रजिस्ट्री, ऑफ़लाइन पैकेज मिरर और बिना किसी आउटबाउंड टेलीमेट्री के आते हैं। अपडेट आपकी परिवर्तन-नियंत्रण प्रक्रिया के माध्यम से हस्ताक्षरित, सत्यापित मीडिया के रूप में दिए जाते हैं।

क्या आप इन्फ़रेंस के साथ फाइन-ट्यूनिंग भी समर्थित करते हैं?

हाँ - निरंतर प्री-ट्रेनिंग, पर्यवेक्षित फाइन-ट्यूनिंग, मल्टी-अडैप्टर सर्विंग सहित LoRA अडैप्टर, DPO व GRPO जैसी प्रेफ़रेंस ऑप्टिमाइज़ेशन, और सस्ती सर्विंग हेतु बड़े शिक्षक मॉडल से छोटे छात्र में डिस्टिलेशन।

मॉडल लाइसेंस के लिए कौन उत्तरदायी है?

ग्राहक ही उस तृतीय-पक्ष मॉडल का लाइसेंसधारी है जिसे वह डिप्लॉय करना चुनता है। Velyrix इंफ्रास्ट्रक्चर और इंजीनियरिंग सेवाएँ देता है, डिप्लॉयमेंट से पहले हर मॉडल की लाइसेंस शर्तें आपके साथ देखता है और परिणामी दायित्व प्रलेखित करता है, पर तृतीय-पक्ष मॉडलों में कोई अधिकार प्रदान नहीं करता।

आप किस प्रदर्शन की प्रतिबद्धता देते हैं?

आपके अपने ट्रैफ़िक पर बेंचमार्किंग चरण के बाद, Velyrix कुल थ्रूपुट (टोकन प्रति सेकंड), p95 पहले-टोकन-तक-समय, p95 अंतर-टोकन लेटेंसी और मासिक एंडपॉइंट उपलब्धता के विशिष्ट आँकड़ों का अनुबंध करता है। ये आँकड़े हर अपग्रेड के बाद पुन: सत्यापित होते हैं।