До основного вмісту
🤖

AI-агенти на VDS

34 статей у розділі

Розділ про розгортання AI-інструментів на власному сервері — без залежності від чужого API і з повним контролем над даними. Початок — що таке AI-агенти і навіщо тримати їх на VDS, встановлення Ollama для запуску локальних LLM, веб-інтерфейс Open WebUI поверх неї та порівняння рушіїв на кшталт vLLM, llama.cpp і Text Generation WebUI під різне залізо.

Далі — побудова власних систем: агенти на LangChain і мультиагентні зв'язки через CrewAI та AutoGen, no-code автоматизація в n8n і візуальний конструктор Flowise, RAG для відповідей за власними документами з векторними базами Chroma, Qdrant або pgvector прямо в PostgreSQL. Розібрано підключення зовнішніх API — OpenAI, Claude і Gemini, оцінку їхньої вартості та порівняння між собою.

Є й прикладні сценарії: Telegram-бот на зв'язці LangChain і Ollama, чат-віджет для сайту на PHP і JavaScript, транскрипція мовлення через Whisper, генерація зображень у Stable Diffusion і ComfyUI, а також розрахунок відеопам'яті під модель і захист агентів від prompt injection.

  • Локальні LLM: Ollama, vLLM, llama.cpp
  • Агенти і RAG: LangChain, CrewAI, векторні БД
  • No-code автоматизація: n8n і Flowise
  • Моніторинг і безпека AI-агентів
AI-агенти: що це таке і навіщо потрібні на VDS AI-агенти — автономні програми на базі LLM. Дізнайтеся, як розгорнути AI-агента на VDS-сервері та які фреймворки обрати. Встановлення Ollama на VDS: запуск локальних LLM Ollama дозволяє запускати Llama 3, Mistral, Phi-3 на VDS. Покрокова інструкція встановлення, налаштування і першого запуску моделі. Open WebUI: веб-інтерфейс для Ollama на VDS Open WebUI — ChatGPT-подібний інтерфейс для локальних моделей Ollama. Встановлення через Docker, налаштування Nginx і багатокористувацький режим. LangChain на VDS: створення AI-агентів на Python LangChain — головний фреймворк для AI-агентів на Python. Встановлення на VDS, підключення до Ollama, створення ланцюжків і перший агент з інструментами. n8n на VDS: автоматизація з AI-агентами без коду n8n — потужний інструмент автоматизації з підтримкою AI-агентів. Встановлення на VDS, підключення до Ollama та створення першого AI-воркфлоу. Flowise на VDS: візуальний конструктор AI-агентів Flowise — drag-and-drop платформа для побудови AI-агентів і LLM-пайплайнів. Встановлення на VDS, підключення Ollama та готові шаблони чат-ботів. RAG на VDS: AI-відповіді за вашими документами RAG (Retrieval-Augmented Generation) дозволяє LLM відповідати на запитання за вашими документами. Повний туторіал із LangChain, Chroma та Ollama на VDS. AI Telegram-бот на VDS з LangChain та Ollama Створіть AI Telegram-бота з пам'яттю діалогу на VDS, використовуючи Python, LangChain і локальну модель Ollama. Покрокова інструкція з повним кодом. Chroma DB на VDS: векторна база даних для RAG Chroma — популярна векторна база даних для RAG-систем. Встановлення на VDS, embedded та server режими, інтеграція з LangChain. Qdrant на VDS: високопродуктивна векторна БД Qdrant — продакшн-готова векторна база даних на Rust для мільярдів векторів. Встановлення на VDS, Python-клієнт та інтеграція з LangChain. OpenAI API на VDS: підключення та оптимізація витрат Підключення OpenAI API до VDS, змішана стратегія Ollama+OpenAI та проксі LiteLLM для команди. Заощаджуйте до 90% на AI-запитах. CrewAI на VDS: команда AI-агентів для складних завдань CrewAI дозволяє створювати команди спеціалізованих AI-агентів. Встановлення на VDS з Ollama, створення агентів з ролями та завданнями. LocalAI на VDS: сумісний з OpenAI сервер моделей LocalAI — повна заміна OpenAI API з локальними моделями. Підтримка тексту, зображень і мовлення. Встановлення на VDS через Docker. Моніторинг AI-агентів на VDS: Langfuse та метрики Моніторинг AI-агентів у продакшені: Langfuse для трасування LLM, метрики токенів та латентності, інтеграція з LangChain на VDS. AutoGen на VDS: мультиагентна система від Microsoft AutoGen — фреймворк Microsoft для мультиагентних систем. Агенти пишуть і запускають код, спілкуються між собою. Встановлення на VDS з Ollama. ChatGPT API: підключення та використання OpenAI API Підключення OpenAI ChatGPT API: отримання ключа, запити до GPT-4o, streaming, PHP та Python приклади, ціни 2025. Claude API (Anthropic): підключення та інтеграція з VPS Claude API від Anthropic: налаштування, приклади PHP і Python, vision, порівняння з ChatGPT GPT-4o, ціни Claude 3.5 Sonnet і Haiku. Stable Diffusion на VPS: генерація зображень на сервері Розгортання Stable Diffusion WebUI на GPU VPS. Встановлення, API, Python інтеграція, вибір GPU-сервера. OpenAI Whisper: транскрипція аудіо та відео на VPS Локальна транскрипція аудіо з Whisper на VPS: встановлення, Python API, Faster-Whisper, підтримка української мови. Google Gemini API: налаштування та використання на VPS Google Gemini API: підключення, приклади на Python і PHP, 1M токенів контексту, мультимодальний аналіз зображень, ціни на Gemini 1.5 Flash і Pro 2025. MCP Server: підключення інструментів до Claude AI Model Context Protocol (MCP): налаштування Claude Desktop, підключення файлової системи та БД, створення MCP-сервера на Python. AI-чатбот для сайту з ChatGPT: PHP + JavaScript-віджет Створення AI-чатбота підтримки на сайті з ChatGPT API: PHP backend, JavaScript-віджет, rate limiting, система промптів, деплой на VPS. Ollama: локальні LLM на VPS без API-ключів Запуск LLaMA 3, Mistral, Gemma на VPS з Ollama: встановлення, REST API, інтеграція з Python, порівняння моделей, приватність даних без зовнішніх сервісів. Порівняння AI API 2025: OpenAI, Claude та Gemini Детальне порівняння LLM API 2025: GPT-4o, Claude 3.5 Sonnet, Gemini 1.5 Pro, Groq, Ollama. Ціни, швидкість, контекст, вибір для задач. Налаштування vLLM на сервері: швидкий інференс LLM Налаштування vLLM на GPU-сервері: вимоги до відеокарти, встановлення, запуск OpenAI-сумісного API та усунення помилок браку пам'яті. llama.cpp і GGUF: запуск мовних моделей на CPU Як запустити мовну модель на процесорі через llama.cpp: формат GGUF, рівні квантування, збірка та перший запуск на сервері без GPU. Text Generation WebUI: вебінтерфейс для LLM на сервері Встановлення Text Generation WebUI на VDS: підключення backend-рушіїв llama.cpp і Transformers, завантаження моделей і чат через браузер. Семантичний пошук на сайті на основі ембеддингів Як побудувати семантичний пошук на сайті на ембеддингах: вибір моделі, генерація векторів, зберігання в базі і видача релевантних статей. pgvector: векторний пошук прямо в PostgreSQL Встановлення pgvector для PostgreSQL: створення векторної колонки, індекс HNSW, пошук найближчих сусідів і типові помилки налаштування на VDS. Векторні бази даних: порівняння Qdrant, Weaviate і Milvus Векторна база даних для RAG і пошуку: чим відрізняються Qdrant, Weaviate і Milvus та що поставити на VDS. Скільки відеопам'яті потрібно моделі: розрахунок VRAM Як розрахувати VRAM під конкретну LLM: формула, таблиці за квантизацією і підбір GPU для VDS. Потокова транскрипція Whisper у реальному часі на сервері Потокова транскрипція на Whisper: нарізка аудіо, VAD, faster-whisper і WebSocket-сервер на VDS. ComfyUI на сервері: збірка конвеєрів генерації зображень Встановлення ComfyUI на VDS із GPU: вузли, готові workflow, запуск через API і розрахунок VRAM. Безпека AI-агентів: захист від prompt injection Як захистити AI-агента від prompt injection: ізоляція інструментів, allowlist дій і моніторинг на VDS.