Github Trends®
5892 findingsmedian surprise 0.00593window 1 day
UNIT / TREND-MONITOR · REV 2.6
[ 1 day window ]
SOURCE: own snapshots
РЕПО НЕТ В ОКНЕ 90D. ПОКАЗАН FINDING ИЗ ОКНА 1D (1 day) — РАНГ #18.
FINDING #18 · UNIT ID 159228916
garychowcmu/daizhigev20
殆知阁古代文献
[ ]ЗАРАБОТОК F · 27/100[ GITHUB ↗ ]
SURPRISE SCORE
0.00

Score Breakdown

SURPRISE0.67
ENGAGEMENT0.78
FRESHNESS1.00
SCORE = SURPRISE × ENGAGEMENT^0.7 × FRESHNESS × VISIBILITY × CONFIDENCE
SURPRISE = WINDOW STARS / DAYS / (AUDIENCE + FLOOR)
10% OF STARS IN ARCHIVE

Growth Telemetry

VELOCITY /D
255.00
ACCEL
0.00
RETENTION
0.0%
PEAK 2026-08-28 · FORK-RETENTION 0.0% · 255 STARS / WINDOW

Author Audience

AUDIENCE
341
FOLLOWERS
79
OWNER ★
2,615

Engagement Signals

FORKS
913
ISSUE AUTH
0
PR AUTH
0
UNIQUE STARGAZERS 255 / 255 (DIVERSITY 1.00)

Потенциал заработка

F27/100
СПРОС70
В теме есть деньги: платные text-access, publishing, digital library и knowledge database продукты уже продаются; proxy-рынки показывают заметный рост.
ЗАХВАТ34
Удержать ценность трудно: конкуренция сильная, raw TXT-дамп легко заменить, а ров появляется только через чистку, метаданные, поиск и лицензию.
ДОСТУП15
Главный стоп-фактор — SPDX: None; также один контрибьютор, нет релизов, нет продуктовой упаковки и неясный provenance текстов.
«Монетизацию топит отсутствие лицензии и юридически чистого provenance.»

Рыночный анализ · Обзор

Это большой TXT-архив древнекитайских текстов для чтения, поиска и корпусной обработки.
digital humanities / corpus / classical Chinese text datasetЗРЕЛОСТЬ · ЗРЕЛЫЙ
ЛИЦЕНЗИЯ
НЕТ · ALL RIGHTS RESERVED
РЕЕСТР
none
КОНТРИБЬЮТОРЫ
1
Что делает

Репозиторий собирает в одном месте древнекитайские тексты в формате TXT. Его можно использовать как сырой корпус для полнотекстового поиска, цифровой гуманитаристики, NLP/LLM-экспериментов и учебных задач. Это не библиотека кода и не готовый продукт, а архив данных с минимальной упаковкой.

Какую боль решает

Закрывает боль разрозненных, плохо индексируемых и трудно скачиваемых классических источников, которые иначе приходится собирать вручную по частям.

Сценарии использования
  • Полнотекстовый поиск по древнекитайским произведениям.
  • Обучение моделей для разметки, сегментации, пунктуации и перевода классического китайского.
  • RAG/LLM-корпус для вопросов по древнекитайским текстам.
  • Digital humanities и филологические исследования.
  • Учебные и справочные интерфейсы для студентов и преподавателей.
Целевой пользователь

NLP/LLM-инженеры, исследователи китайской филологии, digital humanities-команды, преподаватели и студенты классической китайской литературы, команды поисковых и knowledge-base продуктов.

Open-source аналоги

mahavivo/scripta-sinicaСИЛЬНЕЕ352
13k текстов, 10万卷, около 13亿字; более исследовательский и структурный корпус.
2.8亿字, 968 txt, охват от Сун до Республики; уже по охвату и более датасетно ориентирован.
raynardj/yuanСМЕЖНЫЙ111
Проект вокруг classical Chinese с поиском, переводом и пунктуацией; больше toolchain, меньше сырого архива.
xp44mm/hanchuancaoluСЛАБЕЕ70
Классические романы и 13 классиков; заметно уже по корпусу.
dayihengliu/a2m_chineseNMTСМЕЖНЫЙ27
1.24M пар ancient-modern translation; датасет для перевода, а не архив текстов.
sigmeta/ChineseBookCorpusСЛАБЕЕ8
Широкий книжный корпус, но не узко classical Chinese.
Позиционирование

На GitHub это лидер в узкой нише классических текстовых дампов по интересу и звёздам, но не продуктовый лидер: рядом есть более аккуратные корпуса и более полезные инструменты.

Коммерческие аналоги

百度文库B2B / B2CПОДПИСКА
One-stop platform для документов и контента.
14亿专业文档, по данным App Store-описания.
连续包月¥18
连续包月VIP¥18
12个月VIP¥98
CNKI AI全球学术快报 / 知网B2B / B2CПОДПИСКА
Академический поиск, чтение и AI-функции вокруг научных публикаций.
Публично у CNKI указываются 200M+ end users, 16M+ daily visits, 2.3B+ full-text downloads.
AI-подписки38/78/99/168/179/199 元/月
万方数据 / 万方会员B2B / B2CПО ПОТРЕБЛЕНИЮ
Академическая база с поиском и платным доступом к профессиональным публикациям.
5亿优质专业文献 и “数亿条” ресурсов, по собранному описанию.
30万方币¥38
50万方币¥58
108万方币¥98
208万方币¥198
308万方币¥328
518万方币¥598
微信读书B2CПОДПИСКА
Consumer book subscription для чтения электронных книг.
百万优质正版书籍; App Store показывает 169万+ оценок.
Месяц¥19/月
Месяц¥30/月
Квартал¥60/季
Год¥228/年
得到 AppB2CПОДПИСКА
Книги, аудио, курсы и подписка на знания.
110000+ ebooks, 1800+ audiobooks, 400+ courses, по App Store-описанию.
电子书会员¥21/月
听书VIP¥35/月
AI学习圈 首月¥9
AI学习圈 续费¥39
京东读书B2CПОДПИСКА
Reader/subscription platform для электронных книг.
百万好书 и 6.6万+ оценок, по App Store-описанию.
7 дней¥1
31 день¥16
93 дня¥44
366 дней¥148
掌阅精选B2BПОДПИСКА
Institution-friendly curated reading platform для книг и аудиоконтента.
10万册精品书 + 50万集有声书, по собранным App Store и библиотечным описаниям.
Месяц¥38/月
Месяц¥45/月
Год¥348/年
Пакетыот ¥6 до ¥198
Текущая монетизация проекта

По видимым данным сам репозиторий и автор сейчас не монетизируют проект: нет homepage, релизов, sponsors или платной версии; README выглядит как бесплатный архив с просьбой о волонтёрах. Это скорее хобби/общественный архив, чем коммерческий проект.

Коммерческий потенциал

ПОТЕНЦИАЛ · НИЗКИЙ

На самом репозитории заработать безопасно и масштабно нельзя. Деньги возможны только поверх юридически очищенного, нормально индексированного и структурированного корпуса.

Спрос и рынок

Спрос есть не на сырой дамп, а на доступ, поиск, API, подписку и knowledge databases. Как proxy: Digital Library Market оценён в $8B в 2025 → $13.77B в 2030, CAGR 11.4%; Digital Publishing Market — $257.01B в 2025 → $571.48B в 2032, CAGR 12.09%.

Ров / защищённость

Почти нет, если это просто TXT-дамп. Ров появляется только через юридически чистую базу, качество чистки, структуру, метаданные, поиск, API и канал дистрибуции.

Модели монетизации
  • Подписка на поиск и full-text access.
  • Enterprise/API доступ для LLM, edtech и библиотек.
  • Корпоративный deployment on-prem или private cloud.
  • Data cleaning, annotation и chapterization as a service.
  • Open-core: бесплатный корпус и платные hosted search/API.
Что нужно, чтобы сделать продукт
  • Явная лицензия или отдельное разрешение на коммерческое использование.
  • Provenance и источники по каждому тексту.
  • Чистка, дедупликация и разбиение на главы.
  • Метаданные, полнотекстовый поиск, API и версионирование датасета.
  • QA качества текста.
  • Документация и снижение single-maintainer / bus-factor риска.
⚖ ЛИЦЕНЗИЯ · МОЖНО ЛИ КОММЕРЦИАЛИЗИРОВАТЬ
SPDX: None. Значит, по умолчанию это all-rights-reserved; коммерческое использование без отдельного разрешения — high-severity риск.
Риски и подводные камни
ВЫСОКИЙЛИЦЕНЗИЯ
SPDX: None; по умолчанию это all-rights-reserved, коммерческое использование без разрешения несёт высокий юридический риск.
ВЫСОКИЙЮР. СЕРАЯ ЗОНА
Неясный copyright/provenance по корпусу: нет подтверждённых источников и прав по каждому тексту.
СРЕДНИЙПРОЧЕЕ
Качество, дубли, разметка и chapterization требуют существенной ручной и инженерной доработки.
СРЕДНИЙЗАВИСИМОСТЬ ОТ АВТОРА
Контрибьютор фактически один, релизов нет, bus factor высокий.
СРЕДНИЙКОММОДИТИЗАЦИЯ
Сырой текстовый дамп легко заменить бесплатными или публичными корпусами.
СРЕДНИЙПРОЧЕЕ
Дистрибуция через GitHub/Baidu Pan и отсутствие продукта делают использование фрагильным.

Достоверность разбора

УВЕРЕННОСТЬ · СРЕДНЯЯgpt-5.5 · 2026-08-28 · ОКНО 1D
Оговорки / что не проверено
  • Коммерческие цены и масштабы в основном взяты из App Store и страниц продуктов; не все цифры подтверждены двумя независимыми источниками.
  • Оценки OSS-звёзд и позиционирование альтернатив взяты из собранного разбора и не перепроверялись в вебе в этом шаге.
  • Market size для Digital Library и Digital Publishing — proxy-рынки, а не точная оценка рынка древнекитайских корпусов.
  • Правовой статус конкретных текстов внутри архива не проверялся по каждому произведению; вывод основан на SPDX: None и отсутствии явной лицензии.
  • Качество корпуса, дубли, полнота, chapterization и provenance не аудировались фактически, а оценены по README и описанию репозитория.
  • Вывод о текущей немонетизации автора основан на видимых полях GitHub/README из входных данных: homepage, releases, sponsors и платная версия не указаны.
ИСТОЧНИКИ (21)

Why This Is A Finding

garychowcmu/daizhigev20 собрал 255 звёзд за окно, тогда как у автора всего 79 подписчиков — эффективная аудитория ≈ 341. Это даёт surprise-индекс 0.67 (звёзды относительно охвата автора, а не в абсолюте). Удержание форков 0.0% и 0 внешних контрибьюторов отделяют реальный инструмент от разовой вспышки. Акселерация положительная — рост ещё не выдохся.

METRICS IN CONTEXT

MEDIAN ACROSS ALL 5892 FINDINGS · Δ vs MEDIAN · PERCENTILE = SHARE RANKED BELOW
METRICVALUEMEDIANΔ MEDPERCENTILE
SCORE0.560.00+0.56ABOVE 100%
VELOCITY255.009.00+246.00ABOVE 99%
RETENTION0.0%0.0%0.0 PPABOVE 0%
FORKS913433+480ABOVE 64%
SURPRISE0.670.01+0.66ABOVE 99%