Python Developer (русскоязычный)
RealyticsΠεριγραφή θέσης
О Компании
Realytics создаёт движок принятия решений для офлайн-экономики объёмом $30 трлн — AI-агента, который подсказывает любому физическому бизнесу, что делать дальше. Вместо дашборда владелец просто задаёт вопрос и получает ответ аналитика, обоснованный данными: где открыть новую точку, почему уходят клиенты, как вырастить маржу. Мы превращаем аналитику реального рынка, за которую крупнейшие бренды платят миллионы, в решения, доступные любому бизнесу.Под капотом — LLM, которая рассуждает поверх уникальной коллекции данных, обновляемой еженедельно: 200M+ точек, 1M+ сетевых брендов и 10B+ потребительских мнений в 195 странах. Мы AI-native и remote-first стартап с HQ на Кипре.
О Роли
Данные — это фундамент Realytics. Задача Crawler Developer — наполнять этот фундамент: собирать данные из веба в промышленных масштабах и превращать сырой HTML/JSON в чистые структурированные записи, готовые к аналитике.Вы будете владеть пайплайнами целиком — от краулера до строки в ClickHouse. Масштаб: сотни миллионов точек и миллиарды записей, с еженедельным обновлением.
AI-native разработка
Мы разрабатываем AI-native: AI-агенты для кодинга Claude Code/Codex — не вспомогательный инструмент, а основной способ писать код. Мы ждём, что вы свободно работаете с ними каждый день и умеете строить harness — обвязку вокруг агентов (инструменты, циклы обратной связи, автоматические проверки), которая заставляет их надёжно решать реальные задачи: генерировать и чинить парсеры, адаптироваться к изменениям источников, валидировать данные.
Это ключевая компетенция для роли. Вместе с архитектурными навыками её мы проверяем в первую очередь.
Чем предстоит заниматься
- Проектировать и разрабатывать краулеры и парсеры для сбора данных о бизнесах и отзывах
- Строить AI-native инструменты и harness вокруг агентов (Claude Code / Codex): автогенерация и починка парсеров, адаптация к изменениям источников, автоматическая валидация данных
- Превращать сырые данные в структурированные записи: нормализация, валидация, приведение к схеме
- Строить и поддерживать ETL/ELT-пайплайны в Airflow, обеспечивать стабильный еженедельный рефреш в глобальном масштабе
- Решать типовые проблемы масштабного скрейпинга: ротация прокси, rate limiting, ретраи, разбор динамических (JS) страниц
- Настраивать потоковую загрузку через Kafka
- Следить за качеством данных: мониторинг, метрики полноты и консистентности, алерты на деградацию источников
- Оптимизировать пайплайны и хранилища (ClickHouse, PostgreSQL) под объёмы в сотни миллионов записей
Что мы ждем
- AI-native разработка: свободное владение Claude Code / Codex как основным инструментом разработки и опыт создания harness для AI-агентов
- Архитектурные навыки: проектирование пайплайнов и систем, декомпозиция сложных задач, обоснованные технические решения
- Уверенный Python
- Опыт построения и эксплуатации дата-пайплайнов в Airflow (или похожих оркестраторах)
- Практика работы с ClickHouse и PostgreSQL: проектирование схем, оптимизация запросов
- Опыт с Kafka и MongoDB в проде
- Опыт с Kubernetes в проде
- Понимание специфики веб-скрейпинга: прокси, rate limiting, разбор HTML/JSON, динамические страницы
- Внимание к качеству данных: валидация, дедупликация, консистентность
- Комфортная работа с большими объёмами данных (десятки-сотни миллионов записей)
- Headless-браузеры (Playwright / Puppeteer / Selenium) для JS-тяжёлых сайтов
- Опыт промышленной разработки краулеров/парсеров (Scrapy или аналоги)
- Опыт с прокси-инфраструктурой и распределённым краулингом
- Геоданные и H3 (гексагональная индексация)
- Знакомство с NLP
- Опыт с масштабом 100M+ записей и мультистрановыми/мультиязычными данными
- Remote-first: работайте откуда удобно
- HQ на Кипре, при необходимости помогаем с релокацией
- Прямое влияние на ядро продукта — данные, на которых стоит весь Realytics
- Современный стек и масштаб, где инженерные решения реально имеют значение
Σας ενδιαφέρει αυτή η θέση;