Skip to content

Обогащение данных: парсинг сайтов программ и сжатие контекста #2

Description

@qrver

Цель

Расширить JSON-снимки данных смысловой информацией: ключевые особенности программ, компетенции, карьерные треки. Собрать и ужать контент с посадочных страниц программ, убрав повторяющуюся и маркетинговую информацию для минимального контекстного окна LLM.

Почему это важно

Сейчас данные содержат только формальные параметры: названия, коды, баллы, бюджетные места. Для рекомендаций, поиска по смыслу и AI-ассистента нужны:

  • Описание программы своими словами (не шаблонный текст)
  • Перечень ключевых дисциплин и технологий
  • Карьерные перспективы и примеры проектов выпускников
  • Особенности по сравнению с похожими программами

Что нужно реализовать

Этап 1. Сбор сырых данных

  • Парсинг страниц программ с abit.itmo.ru
  • Извлечение описаний, учебных планов, карьерных треков
  • Сохранение в структурированном формате

Этап 2. Контекстное сжатие

  • Удаление повторяющихся блоков (одинаковые описания практик, общие фразы)
  • Удаление маркетинговых шаблонов ("ИТМО — лучший вуз...")
  • Сохранение только уникальной и полезной информации
  • Цель: вместить описание программы в 300–500 токенов

Этап 3. Обогащение существующего формата

  • Добавить поля в JSON-снимки:
    • summary: сжатое описание (1–2 предложения)
    • highlights: ключевые особенности (маркированный список)
    • technologies: технологии и инструменты
    • career_tracks: карьерные треки выпускников
    • similar_programs: ID похожих программ

Результат

Обогащённый датасет, пригодный для семантического поиска и LLM-рекомендаций.

Связь с другими задачами

Metadata

Metadata

Assignees

No one assigned

    Labels

    enhancementNew feature or requestroadmapPlanned features and project vision

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions