परिचय
Agent DVR DeepStack AI, CodeProject AI, PlateRecognizer.com, Claude, Gemini, OpenAI (ChatGPT) और Ollama, vLLM और LM Studio जैसे स्थानीय LLM के साथ पूरी तरह से एकीकृत है ताकि स्मार्ट अलर्ट फिल्टरिंग, ऑब्जेक्ट रिकग्निशन, दृश्य पहचान और बुद्धिमान इवेंट नियंत्रण जोड़ा जा सके।
DeepStack और CodeProject AI के अलावा, आप अन्य AI सर्वर का भी उपयोग कर सकते हैं जो समान API का समर्थन करते हैं:
ऑब्जेक्ट रिकग्निशन और कंप्यूटर विजन
- https://codeproject.github.io/ - क्रॉस प्लेटफ़ॉर्म GPU/CPU आधारित AI प्रोसेसिंग सर्वर
- https://docs.platerecognizer.com/ - लाइसेंस प्लेट पहचान सर्वर (वेब आधारित API)
- https://github.com/runningman84/docker-coral-rest-server - RPi (या Linux/Mac) पर Tensorflow-lite मॉडल Coral USB स्टिक से त्वरण के साथ
- https://github.com/robmarkcole/coral-pi-rest-server/ - Flask ऐप के माध्यम से Coral USB एक्सेलेरेटर पर Tensorflow-lite मॉडल
- https://xnorpx.github.io/blue-onyx/ - Blue Onyx ऑब्जेक्ट डिटेक्शन सेवा
क्लाउड AI सेवाएं
- https://platform.openai.com/ - OpenAI API (ChatGPT, GPT-4 Vision) छवि विश्लेषण और चैट के लिए
- https://console.anthropic.com/ - Anthropic Claude API उन्नत तर्क और छवि समझ के लिए
- https://ai.google.dev/ - Google Gemini API बहु-विध AI क्षमताओं के लिए
- https://docs.anthropic.com/ - Claude API दस्तावेज़
- https://platform.openai.com/docs/ - OpenAI API दस्तावेज़
- https://ai.google.dev/gemini-api/docs - Gemini API दस्तावेज़
स्थानीय AI सर्वर (LLM)
- https://ollama.com/ - Ollama: बड़े भाषा मॉडल स्थानीय रूप से दौड़ना
- https://docs.vllm.ai/ - vLLM: उच्च-थ्रूपुट LLM इन्फरेंस और सेवा
- https://lmstudio.ai/ - LM Studio: स्थानीय LLM के लिए उपयोग में आसान डेस्कटॉप ऐप
- https://github.com/ollama/ollama - Ollama GitHub भंडार
- https://github.com/vllm-project/vllm - vLLM GitHub भंडार
AI मॉडल जोड़ना
कस्टम AI मॉडल आपको Agent DVR की ऑब्जेक्ट डिटेक्शन क्षमता को बिल्ट-इन विकल्पों से परे बढ़ाने देते हैं, उदाहरण के लिए वन्यजीवन, डिलीवरी वाहन या कोई और चीज़ जो एक प्रशिक्षित मॉडल खोज सकता है। अपनी मॉडल फ़ाइलों को Agent DVR में जोड़ने के लिए, सर्वर सेटिंग्स > AI सेटिंग्स पर जाएं और AI मॉडल्स के अंतर्गत ऑब्जेक्ट रिकग्निशन पर क्लिक करें। Agent दो पूर्व-निर्मित मॉडल के साथ आता है जिन्हें Agent DVR के लिए प्रदर्शन-अनुकूलित किया गया है।
इससे पहले कि आप किसी मॉडल को कॉन्फ़िगर करें, आपको इसे Agent DVR के मॉडल्स फ़ोल्डर में जोड़ना होगा (देखें AI मॉडल्स बनाना)। यह आमतौर पर Agent/Media/Models/ONNX पर मिलता है (पथ OS के अनुसार भिन्न हो सकता है)। संपूर्ण पथ मॉडल जोड़ें पृष्ठ पर प्रदर्शित होता है यदि आप अनिश्चित हैं। Agent .onnx मॉडल का उपयोग करता है। आप Python औजारों का उपयोग करके अन्य AI मॉडल प्रारूपों को ONNX में परिवर्तित कर सकते हैं।
एक बार जब आप मॉडल को बना और कॉपी कर दें, तो इसे Agent में जोड़ना आसान है - मॉडल जोड़ने के लिए क्लिक करें:
- नाम: अपने मॉडल को एक नाम दें - यह कुछ भी हो सकता है जो आपको पसंद हो।
- विवरण: मॉडल क्या करता है इसका एक वैकल्पिक विवरण।
- मॉडल फ़ाइल: उस मॉडल फ़ाइल का नाम चुनें जिसे आपने फ़ोल्डर में कॉपी किया है।
- लेबल: लेबल की सूची दर्ज करें (या "वर्ग") जिसे आपका मॉडल CSV प्रारूप में कोट्स के बिना खोजता है (स्पेस स्वचालित रूप से हटाए जाते हैं)।
- लेआउट: चुनें कि आपका मॉडल NCHW या NHWC है। अधिकांश मॉडल NCHW हैं यदि आप अनिश्चित हैं।
- चैनल क्रम: चुनें कि क्या आपका मॉडल छवियों को RGB या BGR में चाहता है। अधिकांश मॉडल RGB का उपयोग करते हैं। यदि आपका मॉडल एकल चैनल (ग्रेस्केल) है तो यह अनदेखा किया जाएगा।
- नॉर्मलाइज़ करें: चुनें कि डेटा को आपके मॉडल में उपयोग किए जाने से पहले कैसे नॉर्मलाइज़ किया जाना चाहिए। अधिकांश मॉडल रीस्केलिंग (0-1) का उपयोग करते हैं, जो पिक्सेल मानों को 255 से विभाजित करता है।
- इमेज पैड करें: यह नियंत्रित करता है कि छवि को इनपुट आयामों तक खींचा जाना चाहिए या काली पट्टियों से पैड किया जाना चाहिए। आमतौर पर सटीकता के लिए छवियों को पैड करना बेहतर होता है।
- NMS उपलब्ध है: यह जांचें कि क्या आपका मॉडल पहले से ही Non-Maximum Suppression को आंतरिक रूप से करता है। अन्यथा Agent स्वयं NMS करेगा। NMS नियंत्रित करता है कि परिणाम आयतों को कैसे फ़िल्टर किया जाता है।
- डिफ़ॉल्ट NMS: NMS के लिए ओवरलैप सीमा निर्धारित करें (डिफ़ॉल्ट 45% ओवरलैप है)।
एक बार जब आप अपने मॉडल को जोड़ दें, तो यह आपके डिवाइस के ऑब्जेक्ट रिकग्निशन टैब में उपयोग के लिए उपलब्ध होगा। यदि आपको समस्याएं आती हैं, तो आप मॉडल कॉन्फ़िगरेशन पर वापस आ सकते हैं और परिवर्तन कर सकते हैं। Agent मॉडल फ़ाइल को पुनः लोड करने का भी समर्थन करता है, इसलिए आप इसे चलते समय नए संस्करण से ऊपर कॉपी कर सकते हैं।
AI सर्वर सेटअप करना
AI सर्वर को सेट अप करने के लिए, मुख्य Agent DVR UI के ऊपर दाईं ओर आइकन पर क्लिक करें। फिर कॉन्फ़िगरेशन के अंतर्गत सेटिंग्स पर क्लिक करें, ड्रॉपडाउन मेनू से AI सेटिंग्स चुनें, और AI सर्वर पर क्लिक करें।
Agent DVR ऑब्जेक्ट रिकग्निशन, फेस रिकग्निशन, ALPR (ऑटोमेटिक लाइसेंस प्लेट रिकग्निशन), और सुपर रेजोल्यूशन (एनहांस) सहित विभिन्न AI सुविधाओं के लिए CodeProject.AI के साथ एकीकृत है। PlateRecognizer.com को एक ALPR प्रदाता के रूप में भी समर्थित किया जाता है। CodeProject.AI ओपन सोर्स, मुफ्त है, और अधिकांश प्लेटफॉर्म के साथ संगत है।
शुरू करने के लिए, अपने प्लेटफॉर्म के लिए एक AI सर्वर इंस्टॉल करें और AI सर्वर पर क्लिक करके और फिर जोड़ें पर क्लिक करके Agent DVR को इससे कनेक्ट करें।
आप Agent DVR में जितने चाहें उतने AI सर्वर जोड़ सकते हैं। Agent DVR में कैमरों को प्रत्येक फ़ंक्शन के लिए विभिन्न AI सर्वर का उपयोग करने के लिए कॉन्फ़िगर किया जा सकता है, या आप सभी कार्यों के लिए एक AI सर्वर का उपयोग कर सकते हैं।
अपने सर्वर को कॉन्फ़िगर करना
- नाम: अपने सर्वर का नाम दें, उदाहरण के लिए, Cat Catcher।
- AI सर्वर URL: अपने AI सर्वर का URL दर्ज करें, उदाहरण के लिए, http://localhost:32168/
- API कुंजी: यदि सेट किया गया है तो अपनी कुंजी दर्ज करें (वैकल्पिक)।
- टाइमआउट: सर्वर अनुरोधों के लिए सेकंड में टाइमआउट।
- रिट्राय डिले: इस सर्वर को विफल अनुरोध को दोबारा करने से पहले सेकंड में समय।
अपनी सेटिंग्स को सहेजने के लिए ठीक है पर क्लिक करें।
OpenAI का उपयोग
OpenAI ("ChatGPT") को आपके वीडियो फीड में क्या हो रहा है इसके बारे में सवालों के जवाब देने के लिए सेट अप करने के लिए, सर्वर सेटिंग्स - AI सेटिंग्स पर जाएं और "Ask AI" के तहत "OpenAI" को चुनें।
- URL: सेवा के लिए URL दर्ज करें। डिफ़ॉल्ट "https://api.openai.com/v1/responses" है।
- OpenAI API की: OpenAI के साथ पंजीकरण करने के बाद, API कुंजियां पृष्ठ पर जाएं और एक नई सीक्रेट की उत्पन्न करें। इस कुंजी को कॉपी करें और निर्दिष्ट फील्ड में पेस्ट करें।
- मॉडल: उपयोग किए जाने वाले मॉडल को निर्दिष्ट करें। डिफ़ॉल्ट gpt-5.4-mini है। OpenAI इसे बाद में हटा या बदल सकता है।
- अधिकतम टोकन: यह प्रति अनुरोध अधिकतम टोकन उपयोग निर्धारित करता है। यदि आपको समस्याओं का सामना करना पड़े, तो /logs.html पर लॉग्स देखें क्योंकि यह टोकन उपयोग से संबंधित हो सकता है।
एक बार OpenAI कॉन्फ़िगर हो जाने के बाद, Ask AI को संदर्भित करें और आपके कैमरा फीड में क्या हो रहा है इसके बारे में सामान्य सवालों के जवाब देने के लिए इसका उपयोग करने के तरीके के बारे में निर्देश प्राप्त करें।
Claude का उपयोग करना
अपने वीडियो फीड में क्या हो रहा है इसके बारे में प्रश्नों का उत्तर देने के लिए Claude AI को सेट अप करने के लिए, सर्वर सेटिंग्स - AI सेटिंग्स पर जाएं और "AI से पूछें" के अंतर्गत "Claude" को चुनें।
- URL: सेवा के लिए URL दर्ज करें। डिफ़ॉल्ट "https://api.anthropic.com/v1/messages" है।
- Claude API कुंजी: Claude के लिए साइन अप करने के बाद, API कुंजी पृष्ठ पर जाएं और एक नई सीक्रेट की बनाएं। इस कुंजी को कॉपी करके फील्ड में पेस्ट करें।
- संस्करण: उपयोग करने के लिए API संस्करण निर्दिष्ट करें। डिफ़ॉल्ट 2023-06-01 है। यह कभी भी Anthropic द्वारा हटाया या बदला जा सकता है।
- मॉडल: उपयोग करने के लिए मॉडल निर्दिष्ट करें। लिखने के समय डिफ़ॉल्ट claude-sonnet-4-6 (Claude Sonnet 4.6) है।
- अधिकतम टोकन: यह प्रति अनुरोध अधिकतम टोकन खर्च को नियंत्रित करता है। यदि आपको समस्याएं हों तो /logs.html पर लॉग्स देखें क्योंकि यह टोकन खर्च से संबंधित हो सकता है।
एक बार Claude कॉन्फ़िगर हो जाने के बाद, अपने कैमरा फीड में सामान्य परिस्थितियों को पहचानने के लिए इसका उपयोग कैसे करें इसके लिए AI से पूछें देखें।
Gemini का उपयोग करना
अपने वीडियो फ़ीड में जो हो रहा है उसके बारे में सवालों का जवाब देने के लिए Gemini को सेट अप करने के लिए, सर्वर सेटिंग्स - AI सेटिंग्स पर जाएं और "Gemini" को "AI से पूछें" के तहत चुनें।
- URL: सेवा के लिए URL दर्ज करें। डिफ़ॉल्ट "https://generativelanguage.googleapis.com" है।
- Gemini API की: Gemini के लिए साइन अप करने के बाद, API कुंजी पृष्ठ पर जाएं और एक नई सीक्रेट की बनाएं। इस की को कॉपी करके फ़ील्ड में पेस्ट करें।
- संस्करण: उपयोग करने के लिए API संस्करण निर्दिष्ट करें। डिफ़ॉल्ट v1beta है। यह किसी बिंदु पर Google द्वारा हटाया या बदला जा सकता है।
- मॉडल: उपयोग करने के लिए मॉडल निर्दिष्ट करें। लिखने के समय डिफ़ॉल्ट gemini-2.5-flash है। एक बार जब आप एक API की दर्ज कर दें, तो Agent आपके खाते के लिए उपलब्ध दृष्टि मॉडल की सूची दिखाएगा।
- अधिकतम टोकन: यह प्रति अनुरोध अधिकतम टोकन खर्च को नियंत्रित करता है। यदि आपको समस्याएं हों तो /logs.html पर लॉग्स देखें क्योंकि यह टोकन खर्च से संबंधित हो सकता है।
एक बार Gemini कॉन्फ़िगर हो जाने के बाद, अपने कैमरा फ़ीड में सामान्य परिदृश्यों को पहचानने के लिए इसका उपयोग करने का तरीका जानने के लिए AI से पूछें देखें।
अन्य LLM सर्वर का उपयोग करना
आप अपने स्वयं के स्थानीय LLM सर्वर (जैसे vLLM, Ollama, और LM Studio) का उपयोग करके Agent DVR द्वारा कैमरे से कैप्चर की गई छवियों का वर्णन करने और अलर्ट इवेंट्स में आपके वीडियो स्ट्रीम में क्या हो रहा है इसके बारे में प्रश्नों का उत्तर दे सकते हैं। वर्णन करें और AI से पूछें देखें।
स्थानीय AI सर्वर को कॉन्फ़िगर करने के लिए, सर्वर सेटिंग्स - AI सेटिंग्स पर जाएं और जिस LLM को उपयोग करना चाहते हैं उसके आगे कॉन्फ़िगर करें बटन पर क्लिक करें (Ollama, vLLM, या LM Studio)।
- URL: उस एंडपॉइंट को निर्दिष्ट करें जहां आपका LLM सर्वर चल रहा है। डिफ़ॉल्ट URL हैं:
- Ollama:
http://localhost:11434/api/chat - vLLM:
http://localhost:8000/v1/chat/completions - LM Studio:
http://localhost:1234/v1/chat/completions
- Ollama:
- API कुंजी: यदि आपके LLM सर्वर को प्रमाणीकरण की आवश्यकता है, तो यहां API कुंजी दर्ज करें। अधिकांश स्थानीय सर्वर को इसकी आवश्यकता नहीं होती जब तक विशेष रूप से कॉन्फ़िगर न किया गया हो।
- मॉडल: छवि विश्लेषण के लिए उपयोग करने के लिए दृश्य-सक्षम मॉडल चुनें। आपको पहले से ही इस मॉडल को अपने LLM सर्वर में डाउनलोड और लोड किया होना चाहिए। Agent कुछ लोकप्रिय विकल्प का सुझाव देता है, जिनमें शामिल हैं:
- Qwen VL मॉडल (उच्च प्रदर्शन)
- Gemma 4 (आकार की अच्छी श्रृंखला)
- Llama 3.2 Vision (Meta)
- Mistral Small 3.1
- moondream (बहुत छोटा, कम-अंत हार्डवेयर के लिए अच्छा, केवल Ollama)
- तापमान: प्रतिक्रियाओं में रचनात्मकता बनाम सटीकता को नियंत्रित करता है (0.0-1.0)। कम मान (0.3-0.4) अधिक तथ्यात्मक, सुसंगत विवरण उत्पन्न करते हैं। उच्च मान (0.6-0.8) अधिक विविध, रचनात्मक प्रतिक्रियाएं उत्पन्न करते हैं। अनुशंसित: सुरक्षा कैमरा विश्लेषण के लिए 0.4।
- अधिकतम टोकन: AI की प्रतिक्रिया में शब्दों/टोकन की अधिकतम संख्या। उच्च मान अधिक विस्तृत विवरण की अनुमति देते हैं लेकिन उत्पन्न होने में अधिक समय लगता है। अनुशंसित: विस्तृत छवि विश्लेषण के लिए 300-500, संक्षिप्त विवरण के लिए 150-250।
- top_p: शब्दावली चयन को सीमित करके प्रतिक्रिया विविधता को नियंत्रित करता है (0.0-1.0)। कम मान अधिक सामान्य शब्दों का उपयोग करते हैं, उच्च मान अधिक विविध शब्दावली की अनुमति देते हैं। अनुशंसित: सटीकता और प्राकृतिक भाषा के अच्छे संतुलन के लिए 0.9।
- top_k: मॉडल को सबसे संभावित अगले शब्दों के शीर्ष K से चुनने के लिए सीमित करता है। कम मान (20-40) अधिक केंद्रित प्रतिक्रियाएं उत्पन्न करते हैं, उच्च मान (80-100) अधिक विविधता की अनुमति देते हैं। अनुशंसित: विश्वसनीय छवि विवरण के लिए 50।
PlateRecognizer.com का उपयोग
Agent DVR में LPR (ANPR या License Plate Recognition) कॉन्फ़िगर करने के लिए, सर्वर सेटिंग्स - AI सेटिंग्स पर जाएं और Plate Recognizer के अंतर्गत विवरण दर्ज करें। Plate Recognizer पर निःशुल्क परीक्षण के लिए साइन अप करें। कोई क्रेडिट कार्ड आवश्यक नहीं है।
- URL: सेवा के लिए URL दर्ज करें। डिफ़ॉल्ट "https://api.platerecognizer.com/v1/plate-reader/" है, या यदि आप अपना स्वयं का उदाहरण होस्ट कर रहे हैं तो अपना स्वयं का सर्वर उपयोग करें।
- टोकन: Plate Recognizer के लिए साइन अप करने के बाद, खाता पृष्ठ पर जाएं और API टोकन की प्रतिलिपि बनाएं।
- क्षेत्र: डिफ़ॉल्ट के लिए खाली छोड़ें या क्षेत्रों की CSV सूची दर्ज करें।
- कॉन्फ़िगरेशन: आवश्यकता पड़ने पर दस्तावेज़ से अतिरिक्त कॉन्फ़िगरेशन मान दर्ज करें।
DoubleTake का उपयोग करना
DoubleTake एक खुला स्रोत प्लेटफ़ॉर्म है जो चेहरा पहचान प्रसंस्करण के लिए एकीकृत API प्रदान करता है:
- CompreFace
- Amazon Rekognition
- DeepStack
- CodeProject.AI Server
- Facebox
आपको DoubleTake को इंस्टॉल करना और अपनी पसंद के चेहरा पहचान विकल्पों के साथ कॉन्फ़िगर करना होगा।
एक बार DoubleTake सेट अप हो जाने के बाद, Agent DVR खोलें और सर्वर सेटिंग्स - AI सेटिंग्स पर जाएं और DoubleTake के आगे कॉन्फ़िगर करें बटन पर क्लिक करें।
अपने doubletake सर्वर का URL दर्ज करें (उदाहरण के लिए http://localhost:3000/) और यदि सेट किया गया हो तो अपना पासवर्ड दर्ज करें।
ठीक है पर क्लिक करें, फिर एक कैमरा संपादित करें और चेहरा पहचान पर जाएं। AI सर्वर विकल्प को DoubleTake पर सेट करें और आवश्यकतानुसार चेहरा पहचान कॉन्फ़िगर करें।
AI मॉड्यूल का प्रबंधन
AI सर्वर सूची में (ऊपर संदर्भित), आपके पास AI सर्वर को कॉन्फ़िगर करने, परीक्षण करने, संपादित करने और हटाने के विकल्प हैं। कॉन्फ़िगर करें बटन पर क्लिक करें ताकि चयनित सर्वर पर उपलब्ध या स्थापित मॉड्यूल प्रदर्शित हों।
Agent DVR आपके सर्वर से वर्तमान मॉड्यूल सूची प्राप्त करता है और प्रत्येक मॉड्यूल को स्थापित करने, हटाने, कॉन्फ़िगर करने और परीक्षण करने के लिए एक यूजर इंटरफेस प्रदान करता है। सभी डिफ़ॉल्ट CodeProject.AI मॉड्यूल के लिए समर्थन प्रदान किया जाता है, हालांकि Agent DVR इनमें से केवल एक उपसमुच्चय का उपयोग करता है।
Agent DVR में ALPR (स्वचालित लाइसेंस प्लेट पहचान), सुपर रेजोल्यूशन, या फेस रिकग्निशन का उपयोग करने के लिए, आपको इस पृष्ठ से संबंधित मॉड्यूल स्थापित करना होगा। आमतौर पर, ये मॉड्यूल डिफ़ॉल्ट सेटिंग्स के लिए पर्याप्त हैं, लेकिन आप प्रत्येक मॉड्यूल के तहत आइकन पर क्लिक करके उन्हें कॉन्फ़िगर कर सकते हैं।