ML-инженер CV
Описание
AI/ML Engineer / Generative AI Engineer ARCHIDIGITAL ищет AI/ML-инженера для разработки интерактивных систем на базе локальных нейросетевых моделей. Нам нужен специалист, который умеет самостоятельно разворачивать модели на локальных GPU-серверах, объединять языковые, голосовые и видео-модели в единую систему и оптимизировать их работу под минимальную задержку. Текущая задача Интерактивная инсталляция «Мягкий телефон Мишки». Это детский телефон с микрофоном и динамиком для детского реабилитационного центра, подключенный к локальному серверу. Пользователь говорит с персонажем Мишкой. Сервер должен принимать голос, распознавать речь, формировать ответ языковой моделью, синтезировать его голосом персонажа и возвращать аудио в телефон с минимальной задержкой. Необходимо разработать серверную часть системы, включая: прием и обработку аудиопотокаSpeech-to-Textработу локальной языковой моделилогику и контекст диалогаText-to-Speech и имитацию голоса персонажапотоковую обработку данныхAPI взаимодействия с устройствомоптимизацию end-to-end latencyстабильную работу системы на локальном сервере Следующее направление работы — GENMIRROR GENMIRROR — интерактивная система ARCHIDIGITAL для нейросетевой обработки видеопотока в реальном времени. Специалист будет участвовать в дальнейшем развитии проекта: подключении новых генеративных моделей, построении и оптимизации локальных inference pipeline, работе с image и video моделями и развитии серверной архитектуры. Основные требования уверенный PythonPyTorchLinuxDockerCUDA и понимание работы GPUопыт развертывания open-source моделей локальнопонимание современных LLMопыт работы со Speech-to-Text и Text-to-Speechопыт с voice cloning или voice conversionпонимание streaming inferenceумение строить системы из нескольких связанных AI-моделейопыт оптимизации inference и задержкипонимание VRAM, quantization и управления GPU-ресурсамиумение самостоятельно изучать, запускать и интегрировать новые open-source модели Будет преимуществом опыт с Whisper, faster-whisper или аналогамиопыт с vLLM, llama.cpp, TensorRT, ONNX Runtimeопыт с современными TTS и voice cloning моделямиопыт с Stable Diffusion, FLUX или генеративными video-моделямиLoRA и fine-tuningWebSocket, gRPC или WebRTCопыт разработки realtime AI-систем Кого мы ищем Нам нужен инженер, способный работать не только с внешними API, а непосредственно с моделями, локальной инфраструктурой и GPU inference. Важно уметь самостоятельно подобрать модель, развернуть ее, интегрировать в систему, оптимизировать и довести до стабильной работы. Формат работы Проектная работа с возможностью постоянного сотрудничества. В отклике желательно прислать GitHub или примеры проектов и кратко описать опыт с локальными LLM, STT, TTS, voice cloning и GPU inference. В первую очередь рассматриваются кандидаты из Санкт-Петербурга и ЛО в связи с необходимостью очных встреч по проектам.