UN NewsWHO releases first global guidelines on child obesity as cases surgeESPN📈 Ovechkin's retirement announcement sparks major ticket price hikePunchBarcelona hails Messi’s remarkable career with ArgentinaThe Jerusalem PostHamam al-Hammami hired by flydubai as part of airline's mass hiring push - reportBollywood HungamaGuneet Monga Kapoor-led Women in Film India and Google Flow join hands to enable AI-powered filmmaking for new creative possibilitiesInquirerDTI maps halal calamansi supply chain in Oriental MindoroCapital FMPharmacists told to be on alert as Kenya confirms imported Ebola caseZDF heuteAktuelle Pressemitteilungen des ZDFCollider‘Mistborn’ Movie Script Is Officially Finished as Brandon Sanderson Reveals Next Step [Exclusive]SDP EspectáculosReseña de Carrie: una buena actualización de Prime Video, pero ¿dónde quedó el horror?Daily MaverickDANCE REVIEW: Elysium — 4 dances of bliss and seduction, transcendence and joy from Cape Ballet AfricaGIGAZINEChatGPTが生成したマンガに「実在するマンガ家の署名」が含まれているとの指摘
The Daily Newsstand · Free, Always
Wednesday, October 7, 2026

Домашний ИИ: простой способ добавить «интеллект» своему компьютеру

Translate

В этой статье мы рассмотрим открытые модели машинного обучения. Они не требуют обязательного подключения к интернету и подписки, никуда не передают ваши данные и достаточно компактные, чтобы их можно было запускать на ПК или ноутбуке. Эксперименты выполнялись на ПК с Core i5-14600, 32 ГБ DDR5 и RTX 3070Ti c 8 ГБ VRAM. Комментарии подготовлены экспертами лаборатории искусственного интеллекта российской ИТ-компании «Криптонит».

Быстрый старт

Есть множество оболочек для запуска моделей: Ollama, Open WebUI, GPT4All, Unsloth Desktop, AnythingLLM и десятки других. В качестве максимально простой и универсальной среды мы рассмотрим LM Studio Bionic для Windows. Она скачивается бесплатно и без VPN, устанавливается за минуту и не требует сложных настроек.

Установщик версии 1.1.1+5 — 620 МБ. Требуемое место на диске: 2,1 ГБ.

Установщик версии 1.1.1+5 — 620 МБ. Требуемое место на диске: 2,1 ГБ.

Локально — значит приватно!

Локальный запуск моделей даёт больше возможностей для контроля приватности и защиты коммерческой тайны. Ваши данные остаются только на вашем компьютере и не загружаются в облако ни в каком виде (пока вы не спутаете локальную модель с облачной в меню программы). Другой ощутимый бонус — отсутствие платежей. Вам не нужно выбирать тарифный план и беспокоиться о том, что может возникнуть перерасход предоплаченных токенов. 

Конечно, вы не запустите у себя что-то вроде Claude Opus 4.6 и GPT-6 Astra — каждая из них требует более 500 ГБ видеопамяти. Однако есть множество повседневных задач, с которыми справляются и легковесные модели. Помимо всевозможной работы с документами, это такие трудоёмкие задачи, как расшифровка аудиозаписей, анализ логов и написание скриптов автоматизации. 

Забегая вперёд, отметим, что в ходе эксперимента именно с помощью анализа логов при помощи ИИ удалось решить проблему с роутером, у которого временами отваливалась одна из трёх беспроводных сетей. Оказалось, что робот-пылесос часто терял связь и буквально DDoS’ил роутер. Ни самостоятельное «гугление», ни обращение в техподдержку не помогло решить проблему, а локальный ИИ сходу предложил действенный способ.

Интернет как опция

Как уже отмечалось выше, локальным моделям не требуется доступ в интернет. Однако если ваши запросы подразумевают поиск в интернете, то добавить такую возможность можно буквально в один клик средствами самой LM Studio.

Технически это добавление функции RAG, позволяющей модели использовать новые данные, неизвестные на момент её обучения.

Удобство часто требует жертв со стороны безопасности, поэтому дважды подумайте, прежде чем включать опцию LM Link. Она делает ваш локальный ИИ доступным через интернет для других ваших устройств. Проще говоря, он перестаёт быть сугубо локальным и становится подвержен тем же рискам компрометации данных, что и облачные ИИ. В наших примерах эта опция везде отключена.

Осознанный выбор

На вкладке Explore автоматически создаётся список доступных моделей. Его можно отсортировать по разным критериям. По умолчанию отмечена опция «рекомендовать только подходящие для данной системы модели». Проще говоря, вам предложат лишь те, которые можно запустить на вашем компьютере.

Однако здесь есть важная особенность: LM Studio исходит из общего объёма ОЗУ и предлагает модели, которые частично выгружаются из видеопамяти в общую. Скорость при этом падает в десятки раз и реально работать с такими моделями некомфортно.

В большинстве случаев лучше вручную выбрать легковесные модели, целиком помещающиеся в VRAM. Например, для той же Gemma 4 доступна облегчённая версия E4B, шустро работающая даже на видеокартах с 8 ГБ памяти. При этом она мультимодальная (работает с текстом и графикой) и поддерживает режим рассуждений (reasoning).

Помимо весов модели значительный объём памяти занимает контекст. В связи с этим рекомендуется не забивать VRAM под завязку самой моделью и ограничивать длину контекста, или долю разрешённой для модели части памяти устройства", — пояснил специалист-исследователь лаборатории ИИ компании "Криптонит" Сергей Кононов

Ещё один универсальный вариант — модель Qwen3.8-9B, которую энтузиасты из проекта Empero получили методом дистилляции знаний из модели Qwen3.5-9B, используя полновесную Qwen3.8 2.4T A95B в качестве учителя. В память нашей видеокарты умещались квантизированные версии Q6_K (7,56 ГБ) и Q5_K_M (6,64 ГБ), однако часть памяти видеопамяти расходуется на контекстное окно. Чтобы оно было достаточно большим, рекомендуется взять более сжатую версию Q4_K_M (5,78 ГБ).

«Действительно большие модели в памяти персонального компьютера просто не поместятся. Поэтому при локальном запуске нужно выбирать самые эффективные из легковесных. Сейчас есть новые подходы к оптимизации моделей. Мы активно применяем их в своей компании и разрабатываем собственные», — сказал руководитель лаборатории искусственного интеллекта компании «Криптонит» Виталий Пирожников.

LM Studio Bionic использует движок llama.cpp, умеющий объединять память нескольких видеокарт. Например, если у вас две карты по 16 ГБ то я вам дико завидую, модель программно получит около 30 ГБ VRAM (пара гигабайт уйдёт на интерфейс и фоновые процессы). Для этого не требуется ни поддержка SLI , ни физический мостик NVLink. Движок просто выполнит послойное разделение модели и распределит веса между графическими процессорами.

Поговори с ИИ

Общаться с моделями можно не только текстом, но и голосом. Один клик в настройках, и у вас появляется собственный голосовой ассистент!

Однако LM Studio разрабатывалась для запуска именно больших языковых моделей, поэтому штатных средств для транскрибации (преобразования аудиозаписей в текст) не предоставляет. На момент написания статьи эта функция заявлена как ожидаемая в будущем.

Упоминаемая в документации локальная модель Voxtral от Mistral AI используется только для голосового ввода в реальном времени. С её помощью вы можете диктовать, но она не работает с файлами.

Транскрибация аудиофайлов

Вне LM Studio существуют сравнительно простые способы превратить аудиозаписи в текст прямо на локальном компьютере. Например, для этого можно воспользоваться открытой мультиязычной моделью Whisper от OpenAI, доступной в разных вариантах. 

Хороший баланс между скоростью и качеством обеспечивает Whisper large-v3-turbo размером около 1,5 ГБ. Её хватит, чтобы более-менее качественно расшифровать интервью, лекцию или подкаст.  Готовый результат можно загрузить как текстовый файл в LM Studio для дальнейшей обработки. 

Скачивается Whisper с Hugging Face.  Помимо модели понадобится «обёртка» для её запуска. Мы выбрали проект whisper.cpp, поскольку в нём есть оптимизация для графических карт с поддержкой CUDA. На странице проекта в GitHub есть готовые бинарники под разные архитектуры. Для нашей тестовой системы наиболее подходящим вариантом был whisper-cublas-12.4.0-bin-x64.zip.

Чтобы его использовать, потребовалось установить CUDA Toolkit 12.4

После установки CUDA Toolkit распакуйте скачанный архив whisper-cublas-12.4.0-bin-x64.zip в папку с коротким путём без пробелов и кириллицы, например «C:\Whisper\».

Создайте подкаталог \models внутри каталога Whisper\ и поместите в него скачанный файл модели. Мы использовали ggml-large-v3-turbo.bin. Эта версия быстрее полновесной large-v3 и работает почти без потери качества.

Обратите внимание, что Whisper.cpp поддерживается только формат GGML (файлы с расширением .bin). Привычный для LM Studio формат GGUF он не понимает.

Whisper корректно работает только с файлами WAV с частотой дискретизации 16 кГц. Если аудиозапись в другом формате, её нужно сначала конвертировать, например — с помощью FFmpeg. 

Допустим, у вас есть запись интервью в файле interview.mp3 Тогда команда его конвертации в WAV с нужными параметрами при помощи FFmpeg будет выглядеть так:

ffmpeg -i interview.mp3 -ar 16000 -ac 1 -c:a pcm_s16le interview.wav

Теперь можно запустить транскрибацию. Откройте командную строку и выполните:

C:\Whisper\whisper-cli.exe -m models/ggml-large-v3-turbo.bin -f interview.wav -l auto -otxt

Вы увидите примерно следующую картину:

Ключ -l auto задаёт автоматическое определение языка. Если нужно прямо указать русский, используйте -l ru.

"Рекомендуется явно указывать язык при транскрибации только в том случае, если есть уверенность, что весь текст именно на этом языке. Модели может быть особенно полезно это знание, если аудиозапись шумная, короткая, или в ней встречается речь с акцентом", — пояснил Сергей Кононов.

Обратите внимание на ключ -otxt. Он указывает, что вывод нужно сохранить в текстовый файл. Иначе текст будет выведен только в консоль! Если же вам нужен файл субтитров, то замените -otxt на -osrt.

В нашей системе с RTX 3070Ti расшифровка интервью длительностью 1 час 6 минут заняла 1 минуту 46 секунд. Без видеокарты этот же процесс идёт минут 20 на каждый час аудиозаписи.

Готовый текстовый файл можно загрузить в LM Studio для дальнейшей обработки с помощью одной из больших языковых моделей. Однако мы рекомендуем сначала открыть его и хотя бы бегло просмотреть.

Распознавание получается приемлемым, но ручное редактирование всё равно потребуется. Часть ошибок проще исправить руками, чтобы ИИ не впадал в петлю рассуждений и не галлюцинировал на ложных данных. Особенно тщательно нужно проверять, как модель распознала имена собственные, числительные и сленговые выражения. Также приходится исправлять атрибуцию (вручную проставлять кому из собеседников принадлежит реплика). Пару раз мы замечали, что на шумных записях во время паузы Whisper интерпретирует фоновые звуки как отдельные слова. Это ещё одна причина отфильтровать запись перед транскрибацией и проверить её после.

Опасные сценарии

В основном окне Bionic помимо чатов есть раздел «Проекты». Теоретически в нём можно создавать какие-то задания, выполняемые на вашем компьютере. Например, найти файлы с определёнными свойствами, автоматически переименовать их по шаблону и так далее. 

На практике мы бы не рекомендовали так делать на данном этапе развития Bionic. Все эти задачи гораздо проще решаются специализированными утилитами (например, файловыми менеджерами и плагинами к ним), либо простейшими скриптами. В отличие от ИИ, они дают предсказуемый результат. Как именно поймёт вашу команду на естественном языке ИИ – даже разработчики не возьмутся сказать заранее. Если очень хочется поэкспериментировать — попробуйте эту функцию в виртуальной машине и сделайте бэкапы заранее. Уже описаны случаи, когда ИИ воспринимал виртуалку как ограничение, которое ему нужно преодолеть, и успешно выходил за пределы гостевой системы, используя уязвимости виртуализации.

Если вы не планируете экспериментировать с агентскими функциями Bionic, достаточно будет установить простую LM Studio. Она занимает меньше места и содержит меньше потенциально опасных функций.

Выводы

Локально запускаемые модели машинного обучения бесплатны и не имеют ограничений на количество запросов. Они могут работать вообще без интернета и снижают риски утечки данных. 

Для сохранения коммерческой тайны компании давно используют развёртывание ИИ в закрытом контуре — на серверах внутренней сети (on-premises), а теперь появились и простые решения для домашних компьютеров. Вы можете буквально за несколько минут установить и настроить бесплатную оснастку для загрузки и запуска открытых моделей. Более того, благодаря современным методам сжатия, вполне рабочие варианты можно запустить на ПК или ноутбуке. 

Если компании могут купить специализированные ускорители и масштабировать серверы для ИИ, то рядовые пользователи вынуждены ограничиваться имеющимся «железом». Вопрос выбора наиболее подходящей конфигурации остаётся открытым. 

Основные ограничения связаны с непомерными требованиями больших языковых моделей к памяти. Когда модель не помещается в видеопамять (VRAM) целиком, часть весов выгружается в общую оперативную память (RAM). При этом инференс сильно замедляется в компьютерах с дискретной архитектурой (соединением CPU и GPU через шину PCIe). Частично этот недостаток устраняют гибридные процессоры (APU) с единым адресным пространством памяти (UMA). Помимо Apple Silicon, это AMD Ryzen AI и Intel Core Ultra.

Такие решения с гибридным процессором и быстрой памятью на одной подложке существенно ускоряют передачу данных. Однако APU проигрывает дискретному GPU по скорости вычислений. Избегая одного «бутылочного горлышка», мы создаём другое. Поэтому рациональнее искать конфигурацию под свои задачи, не ограничиваясь готовыми универсальными решениями с маркетинговым обозначением «AI».

View the original on Хабр →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.