I build end-to-end machine learning — from exploratory analysis and classical statistics to deep learning — and I like doing it the hard, honest way: implementing methods from scratch, validating them against reference libraries, and reporting negative results next to the wins. Every repository below has a bilingual README (EN/RU), and every notebook ships with a beginner's guide that explains the work from zero.
| Project | What it is | Headline result |
|---|---|---|
| 🏈 nfl-player-trajectory-prediction | Kaggle NFL Big Data Bowl 2026: predicting player movement from 4.9M tracking rows; SHAP-embeddings as meta-features | RMSE 3.89 → 2.87 (−26%) |
| 🔮 quantum-rng-nist-sp800-22 | Optical quantum random number generator: 5 NIST tests implemented from definitions + Toeplitz extraction | 1/5 → 5/5 NIST tests pass |
| ☢️ neutron-gamma-pulse-discrimination | ML pulse-shape discrimination for a stilbene scintillator; co-authored research paper included | 99% accuracy on 3 classes |
| 🧊 modelnet40-pointcloud-classification | PointNet, DGCNN and a custom attention-fusion hybrid, all from scratch in PyTorch | 85.5% on 40-class 3D shapes |
| 📉 timeseries-anomaly-detection-jax | Conv autoencoder in JAX/Flax + a five-way optimizer benchmark incl. Muon | 5/5 anomalies, loss −10× |
| 🗄️ service-desk-postgres | PostgreSQL service-desk DB: SCD2 history, validation triggers, partitioning, EXPLAIN demos | 8 tables · 112k rows · full ERD |
| 🛡️ llm-hallucination-detection | Hallucination detector for GigaChat3-10B: internal-state probing (257 features) + LLM-as-judge blend | PR-AUC 0.796 at 5.7 ms overhead |
| 🧩 avito-service-splitter | Hybrid NLP pipeline splitting multi-service classified ads: Aho-Corasick + heuristics + boosting + LLM drafts | F1 0.41 → 0.79, CPU-only |
Left: each pipeline stage cutting prediction error on the NFL task. Right: the quantum RNG failing 4 of 5 NIST randomness tests before extraction — and passing all 5 after.
Machine learning & NLP — multinli-lora-finetuning (F1 0.823 with 1.6% trainable params) · fastspeech2-tts-from-scratch (TTS built module by module) · bank-propensity-scoring (461k×488, stacking, ROC-AUC 0.741) · steam-games-popularity-prediction
From-scratch foundations — ml-from-scratch (metrics, kNN, logreg, trees, ensembles — numbers match sklearn) · optimization-methods-from-scratch (Newton, momentum, subgradients, Frank–Wolfe, ILP) · deep-learning-projects (training loops → BERT → graphs → custom Muon optimizer)
Statistics & experiments — statistics-casebook (A/B cases: power, MDE, Bonferroni, a selection-bias demo + 12-part inference workbook) · applied-ml-pipelines · gaussian-kernel-approximation
AI safety — ai-safety-experiments (adversarial attacks + Grad-CAM, GPT-2 concept erasure)
Apps & engineering — coworking-booking-system (Go + Java Spring + React microservices) · vlm-math-reasoning (VLM visual math QA, MathVista 0.717) · travel-weather-planner · igs-cyberspace-app
Python · PyTorch · JAX / Flax / Optax · scikit-learn · XGBoost / LightGBM / CatBoost · HuggingFace Transformers / PEFT · Optuna · SHAP · pandas / NumPy / SciPy · statsmodels · CVXPY · PostgreSQL / SQL · Plotly / matplotlib / seaborn
Я собираю machine learning от начала до конца — от разведочного анализа и классической статистики до глубокого обучения — и предпочитаю честный трудный путь: реализовывать методы с нуля, сверять их с эталонными библиотеками и показывать отрицательные результаты рядом с победами. У каждого репозитория — README на двух языках, у каждого ноутбука — гайд для новичка, объясняющий работу с нуля.
Флагманы: предсказание траекторий игроков NFL (Kaggle, −26% ошибки) · детекция галлюцинаций LLM по внутренним состояниям модели (PR-AUC 0.796 при 5.7 мс) · разбиение мультисервисных объявлений гибридным NLP-пайплайном (F1 0.79 на CPU) · квантовый генератор случайных чисел с NIST-сертификацией (1/5 → 5/5 тестов) · нейтрон/гамма-классификация сигналов сцинтиллятора (99%, с научной статьёй) · 3D-классификация облаков точек (85.5%, три архитектуры с нуля) · поиск аномалий во временных рядах на JAX (5/5 аномалий) · PostgreSQL-база сервис-деска (SCD2, триггеры, партиционирование).
Фундамент: классический ML и методы оптимизации, реализованные вручную и сверенные с библиотеками; статистический кейсбук по A/B-тестам (мощность, MDE, Бонферрони и наглядная демонстрация ошибки отбора); эксперименты по безопасности ИИ (adversarial-атаки, стирание концептов в GPT-2).
📫 Открыта к предложениям и интересным задачам в Data Science / ML.

