
Вики как данные
Вики как данные, а не набор страниц: база знаний должна годиться для поиска и для ИИ.
Три задачи, которые оказались одной
За несколько месяцев пришли три разных запроса.
Первый. Коллега перестраивала структуру главной страницы базы знаний. Нужна была выгрузка содержимого всех разделов — не картинки, именно текст. Нельзя строить новую структуру, не понимая, что лежит в каждой странице и насколько она актуальна.
Второй. Выгрузка структуры целиком, включая закрытые блоки.
Третий. Доступ к выгрузке открытых разделов — чтобы сделать аналитику по ролям: кому какие инструкции изучить.
Три заказчика, три цели. Общее одно: всем нужна база знаний не как сайт, а как данные.
Почему это не одно и то же
Вики устроена для чтения человеком: зашёл, нашёл, прочитал.
Но целый класс задач требует другого — посмотреть на всю базу целиком. Найти дубли. Понять, где пусто. Сопоставить с ролями. Скормить нейросети.
Ни одну из них нельзя решить, открывая страницы по одной.
Как уточнял задачу
Прежде чем делать, задал два вопроса, которые сильно меняли работу:
- Выгружать закрытую структуру вместе с вложениями или достаточно папок?
- Страницы в текстовом формате устроит или нужен PDF со скриншотом?
Разница огромная. Текст — это данные: искать, сравнивать, анализировать. PDF со скриншотом — картинка, красивая и бесполезная для анализа.
Люди часто просят «выгрузку», подразумевая разные вещи. Полминуты на уточнение экономят день работы не в ту сторону.
Вывод
Когда одна и та же просьба приходит от трёх разных людей с разными целями — это не три задачи. Это одна инфраструктурная задача, которую надо решить один раз и нормально.
Их легко проглядеть: каждая по отдельности выглядит мелкой и частной.