Цель
Расширить JSON-снимки данных смысловой информацией: ключевые особенности программ, компетенции, карьерные треки. Собрать и ужать контент с посадочных страниц программ, убрав повторяющуюся и маркетинговую информацию для минимального контекстного окна LLM.
Почему это важно
Сейчас данные содержат только формальные параметры: названия, коды, баллы, бюджетные места. Для рекомендаций, поиска по смыслу и AI-ассистента нужны:
- Описание программы своими словами (не шаблонный текст)
- Перечень ключевых дисциплин и технологий
- Карьерные перспективы и примеры проектов выпускников
- Особенности по сравнению с похожими программами
Что нужно реализовать
Этап 1. Сбор сырых данных
- Парсинг страниц программ с
abit.itmo.ru
- Извлечение описаний, учебных планов, карьерных треков
- Сохранение в структурированном формате
Этап 2. Контекстное сжатие
- Удаление повторяющихся блоков (одинаковые описания практик, общие фразы)
- Удаление маркетинговых шаблонов ("ИТМО — лучший вуз...")
- Сохранение только уникальной и полезной информации
- Цель: вместить описание программы в 300–500 токенов
Этап 3. Обогащение существующего формата
- Добавить поля в JSON-снимки:
summary: сжатое описание (1–2 предложения)
highlights: ключевые особенности (маркированный список)
technologies: технологии и инструменты
career_tracks: карьерные треки выпускников
similar_programs: ID похожих программ
Результат
Обогащённый датасет, пригодный для семантического поиска и LLM-рекомендаций.
Связь с другими задачами
Цель
Расширить JSON-снимки данных смысловой информацией: ключевые особенности программ, компетенции, карьерные треки. Собрать и ужать контент с посадочных страниц программ, убрав повторяющуюся и маркетинговую информацию для минимального контекстного окна LLM.
Почему это важно
Сейчас данные содержат только формальные параметры: названия, коды, баллы, бюджетные места. Для рекомендаций, поиска по смыслу и AI-ассистента нужны:
Что нужно реализовать
Этап 1. Сбор сырых данных
abit.itmo.ruЭтап 2. Контекстное сжатие
Этап 3. Обогащение существующего формата
summary: сжатое описание (1–2 предложения)highlights: ключевые особенности (маркированный список)technologies: технологии и инструментыcareer_tracks: карьерные треки выпускниковsimilar_programs: ID похожих программРезультат
Обогащённый датасет, пригодный для семантического поиска и LLM-рекомендаций.
Связь с другими задачами