Skip to main content

Python Developer (русскоязычный)

Technology
Realytics
Πριν από 1 εβδομάδεςΜέχρι 14/9/2026
Πλήρης απασχόλησηΣτο χώρο

Περιγραφή θέσης

О Компании

Realytics создаёт движок принятия решений для офлайн-экономики объёмом $30 трлн — AI-агента, который подсказывает любому физическому бизнесу, что делать дальше. Вместо дашборда владелец просто задаёт вопрос и получает ответ аналитика, обоснованный данными: где открыть новую точку, почему уходят клиенты, как вырастить маржу. Мы превращаем аналитику реального рынка, за которую крупнейшие бренды платят миллионы, в решения, доступные любому бизнесу.

Под капотом — LLM, которая рассуждает поверх уникальной коллекции данных, обновляемой еженедельно: 200M+ точек, 1M+ сетевых брендов и 10B+ потребительских мнений в 195 странах. Мы AI-native и remote-first стартап с HQ на Кипре.

О Роли

Данные — это фундамент Realytics. Задача Crawler Developer — наполнять этот фундамент: собирать данные из веба в промышленных масштабах и превращать сырой HTML/JSON в чистые структурированные записи, готовые к аналитике.

Вы будете владеть пайплайнами целиком — от краулера до строки в ClickHouse. Масштаб: сотни миллионов точек и миллиарды записей, с еженедельным обновлением.

AI-native разработка

Мы разрабатываем AI-native: AI-агенты для кодинга Claude Code/Codex — не вспомогательный инструмент, а основной способ писать код. Мы ждём, что вы свободно работаете с ними каждый день и умеете строить harness — обвязку вокруг агентов (инструменты, циклы обратной связи, автоматические проверки), которая заставляет их надёжно решать реальные задачи: генерировать и чинить парсеры, адаптироваться к изменениям источников, валидировать данные.

Это ключевая компетенция для роли. Вместе с архитектурными навыками её мы проверяем в первую очередь.

Чем предстоит заниматься

  • Проектировать и разрабатывать краулеры и парсеры для сбора данных о бизнесах и отзывах
  • Строить AI-native инструменты и harness вокруг агентов (Claude Code / Codex): автогенерация и починка парсеров, адаптация к изменениям источников, автоматическая валидация данных
  • Превращать сырые данные в структурированные записи: нормализация, валидация, приведение к схеме
  • Строить и поддерживать ETL/ELT-пайплайны в Airflow, обеспечивать стабильный еженедельный рефреш в глобальном масштабе
  • Решать типовые проблемы масштабного скрейпинга: ротация прокси, rate limiting, ретраи, разбор динамических (JS) страниц
  • Настраивать потоковую загрузку через Kafka
  • Следить за качеством данных: мониторинг, метрики полноты и консистентности, алерты на деградацию источников
  • Оптимизировать пайплайны и хранилища (ClickHouse, PostgreSQL) под объёмы в сотни миллионов записей

Стек Python · Scrapy · Airflow · Kafka · ClickHouse · PostgreSQL · MongoDB · MongoDB

Что мы ждем

  • AI-native разработка: свободное владение Claude Code / Codex как основным инструментом разработки и опыт создания harness для AI-агентов
  • Архитектурные навыки: проектирование пайплайнов и систем, декомпозиция сложных задач, обоснованные технические решения

  • Уверенный Python
  • Опыт построения и эксплуатации дата-пайплайнов в Airflow (или похожих оркестраторах)
  • Практика работы с ClickHouse и PostgreSQL: проектирование схем, оптимизация запросов
  • Опыт с Kafka и MongoDB в проде
  • Опыт с Kubernetes в проде
  • Понимание специфики веб-скрейпинга: прокси, rate limiting, разбор HTML/JSON, динамические страницы
  • Внимание к качеству данных: валидация, дедупликация, консистентность
  • Комфортная работа с большими объёмами данных (десятки-сотни миллионов записей)

Будет плюсом
  • Headless-браузеры (Playwright / Puppeteer / Selenium) для JS-тяжёлых сайтов
  • Опыт промышленной разработки краулеров/парсеров (Scrapy или аналоги)
  • Опыт с прокси-инфраструктурой и распределённым краулингом
  • Геоданные и H3 (гексагональная индексация)

  • Знакомство с NLP
  • Опыт с масштабом 100M+ записей и мультистрановыми/мультиязычными данными

Условия
  • Remote-first: работайте откуда удобно
  • HQ на Кипре, при необходимости помогаем с релокацией
  • Прямое влияние на ядро продукта — данные, на которых стоит весь Realytics
  • Современный стек и масштаб, где инженерные решения реально имеют значение
Keywords
pythonrealyticsartificial-intelligencelarge-language-model-llmcommand-centerjsonclickhouseclaude-by-anthropicclaude-codecodexextract-transform-and-load-etlelectronic-titleextract-load-transform-eltairflowapache-airflowkafkapostgresqlpostgresscrapymongodb

Σας ενδιαφέρει αυτή η θέση;