Github Trends®
6158 findingsmedian surprise 0.00708window 1 day
UNIT / TREND-MONITOR · REV 2.6
[ 1 day window ]
SOURCE: own snapshots
FINDING #09 · UNIT ID 1407997858
mw00/project-maya
Project Maya - GLM-5.3-Flash (321B MoE) on your own NVIDIA GPU(s): engine, server, dashboard, quant tools. Built on Strata.
[ C++ ]ЗАРАБОТОК C · 46/100[ GITHUB ↗ ]
SURPRISE SCORE
0.00

Score Breakdown

SURPRISE1.11
ENGAGEMENT2.17
FRESHNESS1.00
SCORE = SURPRISE × ENGAGEMENT^0.7 × FRESHNESS × VISIBILITY × CONFIDENCE
SURPRISE = WINDOW STARS / DAYS / (AUDIENCE + FLOOR)
34% OF STARS IN ARCHIVE

Growth Telemetry

VELOCITY /D
75.00
ACCEL
0.00
RETENTION
0.0%
PEAK 2026-10-09 · FORK-RETENTION 0.0% · 75 STARS / WINDOW

Author Audience

AUDIENCE
27
FOLLOWERS
5
OWNER ★
223

Engagement Signals

FORKS
35
ISSUE AUTH
0
PR AUTH
0
UNIQUE STARGAZERS 75 / 75 (DIVERSITY 1.00)

Потенциал заработка

C46/100
СПРОС82
Деньги в теме есть: GPUaaS и inference растут, GLM-5.3-Flash уже продаётся как API у Ollama, Together и Fireworks примерно по $0.15 input / $0.50 output per 1M tokens.
ЗАХВАТ31
Захватить value трудно: Ollama, llama.cpp, vLLM, LocalAI и hosted GLM API сильнее по бренду, дистрибуции и зрелости; Maya молодая, MIT и легко форкается.
ДОСТУП68
MIT license у проекта и заявленная MIT-лицензия модели благоприятны, но practically нужны стабильность, security hardening, signed binaries, enterprise docs, поддержка Windows/AMD и снижение bus factor.
«Коммерческий потенциал есть, но его топит слабый capture на фоне сильных OSS и hosted GLM API.»

Рыночный анализ · Обзор

Project Maya — рантайм, сервер и веб-дашборд для локального запуска огромной open-weight модели GLM-5.3-Flash 321B MoE на собственных GPU.
local LLM inference / self-hosted AI runtime / LLM serving / quantized MoE inferenceЗРЕЛОСТЬ · ЭКСПЕРИМЕНТ
ЯЗЫК
C++
ЛИЦЕНЗИЯ
MIT
РЕЕСТР
pypi
РЕЛИЗ
v1.0.30
КОНТРИБЬЮТОРЫ
13
УСТАНОВКА: pip install project-maya
Что делает

Maya запускает GLM-5.3-Flash локально, распределяя экспертов модели между VRAM, RAM и NVMe SSD. Проект включает engine, сервер, браузерный чат, OpenAI-/Anthropic-compatible API и инструменты квантования. Идея — дать пользователю приватный inference большой MoE-модели без облачного провайдера.

Какую боль решает

Решает боль приватного локального запуска очень большой LLM, который обычно требует серверов с сотнями гигабайт GPU-памяти или платного API.

Сценарии использования
  • Приватный локальный чат с большой LLM на workstation с RTX 4090, V100 или несколькими GPU.
  • Локальная OpenAI-compatible API-заглушка для IDE, агентов, внутренних скриптов и RAG-пайплайнов.
  • Air-gapped или privacy-sensitive inference для юридических, финансовых, медицинских и корпоративных документов.
  • Эксперименты с quantization и MoE offloading: Maya-S/S24/M/L, бенчи, подбор железа.
  • Домашняя или SMB-замена платных GLM API при большом объёме токенов и уже купленном GPU/RAM/NVMe.
Целевой пользователь

Технически сильные энтузиасты local AI, ML-инженеры, small teams, privacy-conscious разработчики и владельцы workstation/старых datacenter GPU; хуже подходит обычному B2C-пользователю из-за требований к железу и установке.

Open-source аналоги

ollama/ollamaСИЛЬНЕЕ★ 182,600
Универсальный локальный раннер моделей с CLI/API и большой экосистемой; не сфокусирован на одном GLM-5.3-Flash quant/offload-рецепте.
ggml-org/llama.cppСИЛЬНЕЕ★ 130,700
Базовый C/C++ inference engine для GGUF и множества моделей; Maya скорее специализированная надстройка/форк-логика вокруг GLM-5.3-Flash и tiered expert caching.
vllm-project/vllmСИЛЬНЕЕ★ 93,400
Production-grade serving engine для GPU-кластеров, throughput, PagedAttention и server workloads; Maya ориентирована на локальный PC/workstation offload на RAM/NVMe.
nomic-ai/gpt4allСИЛЬНЕЕ★ 77,400
Desktop/local LLM app для массового пользователя и коммерческого использования; обычно работает с меньшими и более простыми моделями, чем 321B MoE.
mudler/LocalAIСИЛЬНЕЕ★ 48,042
Self-hosted OpenAI-compatible runtime с множеством backends, voice/vision/agents; Maya уже и сфокусирована на GLM-5.3-Flash на consumer/workstation hardware.
oobabooga/text-generation-webuiСИЛЬНЕЕ★ 47,700
Desktop/web UI для local LLMs, vision, tools и API; Maya более engine-heavy и заточена под одну огромную MoE-модель.
SillyTavern/SillyTavernСМЕЖНЫЙ★ 34,100
LLM frontend для power users/roleplay; не engine для inference и может работать поверх Ollama, llama.cpp или API.
Позиционирование

Project Maya не лидер рынка local inference, а очень ранний нишевый проект с отличимой специализацией: локальный запуск GLM-5.3-Flash 321B MoE на доступном железе через tiered expert caching и готовые quants Maya-S/S24/M/L. В OSS-экосистеме это нишевый догоняющий, но не простой клон.

Коммерческие аналоги

Ollama Cloud / paid plansB2B / B2CFREEMIUM
Локальный раннер и облачные open models, включая GLM, Kimi, DeepSeek, Qwen и другие; локальный запуск бесплатен, облако монетизируется usage credits.
TechCrunch писал о nearly 9M users и $65M раунде; это внешний media report, не audited financials.
Free$0
Pro$20/mo или $200/year, включает $60 usage credits/month
Max$100/mo, включает $300 usage credits/month
Team$500/mo, включает $1,000 shared usage credits/month
GLM-5.3-Flash usage$0.15 / 1M input, $0.03 / 1M cached input, $0.50 / 1M output
LM Studio BionicB2B / B2CFREEMIUM
Desktop app для локальных LLM с optional cloud inference и zero-data-retention cloud.
Публично подтверждённые revenue/users в собранном анализе не найдены; популярность высокая, но без фиксированной цифры.
Free$0
Bionic+$20/month
Pro$100/month
MstyB2B / B2CFREEMIUM
Private AI workspace: локальные и онлайн-модели, knowledge stacks, agents и workflows.
Публично подтверждённые users/revenue в собранном анализе не найдены.
Free$0 forever
Aurum$149/user/year
Aurum Lifetime$349/user
Fireworks AIB2BПО ПОТРЕБЛЕНИЮ
Hosted inference, fine-tuning и deployments для open models; прямой substitute для сценария «не хочу self-host, хочу быстрый GLM-5.3-Flash API».
Fireworks заявляла $1.505B Series D, $17.5B valuation, >$1B annualized revenue run rate и >40T tokens/day; это self-reported company blog.
GLM 5.3 Flash Standard$0.15 input / $0.03 cached / $0.50 output per 1M tokens
GLM 5.3 Flash Priority$0.1875 input / $0.0375 cached / $0.625 output per 1M tokens
On-demand H100/H200$8/hour
On-demand B200$13/hour
On-demand B300$15/hour
On-demand GB300$20/hour
Together AIB2BПО ПОТРЕБЛЕНИЮ
Serverless inference, provisioned throughput, dedicated inference, GPU clusters и fine-tuning.
Together announced $800M Series C in July 2026; Sacra estimated $1B annualized revenue in Feb 2026, но это estimate, не audited.
GLM-5.3-Flash$0.15 input / $0.03 cached / $0.50 output per 1M tokens
GLM-5.3$1.40 input / $0.26 cached / $4.40 output per 1M tokens
Dedicated inference NVIDIA HGX H100$5.49/GPU-hour
Dedicated inference B200$8.99/GPU-hour
GPU clusters H100 on-demand$3.99/GPU-hour
GPU clusters H200 on-demand$5.99/GPU-hour
GPU clusters B200 on-demand$8.19/GPU-hour
Hugging Face Inference EndpointsB2BПО ПОТРЕБЛЕНИЮ
Managed dedicated endpoints для моделей с Hugging Face Hub с hourly billing по instance type.
Hugging Face — крупный ecosystem player; Axios/AP сообщали о сделке Nvidia/Hugging Face около $13B и ранее около $400M raised, но это company-level, не конкретно Inference Endpoints.
NVIDIA T4 x1$0.50/hour
NVIDIA L4 x1$0.80/hour
NVIDIA A10G x1$1.00/hour
NVIDIA L40S x1$1.80/hour
NVIDIA A100 x1$2.50/hour
RunPodB2BПО ПОТРЕБЛЕНИЮ
GPU cloud, pods, serverless inference и clusters; альтернатива покупке собственного железа.
RunPod заявил >$120M ARR в официальном press release; TechCrunch также писал о $120M annual revenue run rate.
RunPod Serverlessfrom $0.58/hour 16GB class to $9.98/hour 280GB B300, metered per second
OpenAI APIB2B / B2CПО ПОТРЕБЛЕНИЮ
Managed frontier API; не локальный, но главный коммерческий substitute для сценария «платить per token вместо локального запуска».
Axios сообщал об annualized revenue $50B на 2026-10-08; это media report, не audited.
gpt-6-luna short context$0.20 input / $0.02 cached / $1.00 output per 1M tokens
gpt-6-astra short context$20 input / $2 cached / $100 output per 1M tokens
chat-latest$5 input / $0.50 cached / $30 output per 1M tokens
Anthropic Claude APIB2BПО ПОТРЕБЛЕНИЮ
Hosted frontier models/API, сильный конкурент в coding, agents и enterprise.
Anthropic официально объявляла $65B Series H, $965B post-money valuation и revenue run-rate >$47B earlier in May 2026; это company announcement.
Claude Sonnet 5$2 input / $10 output per MTok
Claude Opus 5$5 input / $25 output per MTok
Claude Haiku 4.5$1 input / $5 output per MTok
Batch API50% discount на input/output
Текущая монетизация проекта

Сам Project Maya пока почти не монетизируется: в README есть ссылка Buy Me a Coffee на https://buymeacoffee.com/peasantsmith, то есть donationware/support. В собранных данных нет подтверждённых признаков paid cloud, open-core, enterprise support, paid installers, paid model hosting, GitHub Sponsors или коммерческой компании.

Коммерческий потенциал

ПОТЕНЦИАЛ · СРЕДНИЙ

Заработать можно, но не на библиотеке как таковой, а на превращении Maya в продукт для приватного локального/air-gapped inference GLM-5.3-Flash: paid support, enterprise installer, hardware recipes, managed on-prem deployment, validated quants и SLA.

Спрос и рынок

Спрос подтверждён тем, что платные GLM-5.3-Flash API уже есть у Ollama, Together и Fireworks, а GPU inference/GPUaaS рынок по приведённым источникам растёт. Fortune Business Insights оценивает GPUaaS в $8.66B in 2026 → $162.54B by 2034, CAGR 44.3%; Grand View Research даёт $5.1B in 2026 → $14.4B by 2033, CAGR 16.0%.

Ров / защищённость

Пока ров слабый: MIT позволяет форкать, llama.cpp/Ollama могут добавить похожий путь, hosted GLM API дешевы для многих workloads, а проект очень молодой. Потенциальный ров возможен через глубокую оптимизацию GLM-5.3-Flash MoE, собственные quants Maya-S/S24/M/L, hardware compatibility database, community benchmarks и enterprise hardening.

Модели монетизации
  • Платная enterprise support и consulting: air-gapped установка, подбор железа, workload tuning, SLA на обновления и security fixes.
  • Validated hardware bundles и reference builds: Maya-certified workstation, dual V100 used-server kit, партнёрства с workstation builders.
  • Платный installer / desktop product: подписанный installer, GUI setup wizard, auto-update, health checks, model download manager, Pro tier.
  • Enterprise control plane: управление несколькими локальными Maya nodes, audit logs, API keys, quota, team dashboard, monitoring.
  • Premium quants / benchmarked model packs с проверенными checksums, стабильностью и speed/quality profiles.
  • Training, fine-tuning, adapter services, evals и prompt-cache recipes.
Что нужно, чтобы сделать продукт
  • Reproducible builds, security review и signed releases для доверия.
  • Enterprise install guide, threat model, data-flow diagram и license notices.
  • Стабилизация Windows/AMD, которые сейчас experimental.
  • One-click binary releases, чтобы снизить C++/CUDA build pain.
  • Compatibility matrix по GPU/RAM/NVMe, speed, драйверам, ROCm/CUDA versions.
  • SLA, roadmap и понятная support-модель.
  • Benchmarks против Ollama/llama.cpp/vLLM/Together/Fireworks, включая cost-per-1M-token локально vs API.
⚖ ЛИЦЕНЗИЯ · МОЖНО ЛИ КОММЕРЦИАЛИЗИРОВАТЬ
MIT — коммерчески благоприятно. Можно использовать, модифицировать, встраивать в закрытые продукты, продавать поддержку, SaaS/on-prem bundles и enterprise installers при сохранении copyright/license notices. Это не GPL/AGPL, поэтому нет жёсткого copyleft-риска для закрытых деривативов или SaaS.
Риски и подводные камни
ВЫСОКИЙЗАВИСИМОСТЬ ОТ АВТОРА
Проекту несколько дней, владелец — небольшой GitHub user по входным данным, production reliability не доказана.
ВЫСОКИЙКОНКУРЕНЦИЯ
Ollama, llama.cpp, vLLM, LocalAI и коммерческие API могут быстро забрать use case и канал дистрибуции.
ВЫСОКИЙПРОЧЕЕ
Hardware support risk: 100–160GB model files, NVMe streaming, CUDA/ROCm/Windows issues; поддержка пользователей может съесть маржу.
СРЕДНИЙПРОЧЕЕ
Model dependency risk: Maya сильно завязана на GLM-5.3-Flash, его popularity, license и weights availability; новая модель или более дешёвый API может снизить ценность.
СРЕДНИЙЮР. СЕРАЯ ЗОНА
Supply-chain/security risk: installer скачивает зависимости, llama.cpp pinned commit и model shards; enterprise потребует SBOM, checksums, signed artifacts и reproducible builds.
СРЕДНИЙПРОЧЕЕ
Performance expectation risk: пользователь увидит «321B on your GPU» и будет ожидать cloud-like latency, но реальная скорость зависит от VRAM/RAM/NVMe/PCIe.
НИЗКИЙЛИЦЕНЗИЯ
Юридический риск низкий при MIT, но нужно сохранять notices Strata, llama.cpp, model licenses и bundled dependencies.

Достоверность разбора

УВЕРЕННОСТЬ · СРЕДНЯЯgpt-5.5 · 2026-10-10 · ОКНО 1D
Оговорки / что не проверено
  • Значительная часть фактов о самом Project Maya взята из README и входных данных воронки без независимой перепроверки.
  • Числа stars у OSS-аналогов, кроме входных данных по Project Maya, взяты из собранного анализа и могли быть не подтверждены двумя независимыми источниками.
  • Scale/revenue/users у Ollama, RunPod, OpenAI и некоторых других игроков часто основаны на media reports или company announcements, не на audited financials.
  • Fireworks, Anthropic и часть коммерческих scale-метрик являются self-reported company announcements.
  • Оценки рынков GPUaaS от Fortune Business Insights и Grand View Research расходятся; это market research estimates, а не фактическая выручка рынка.
  • Публично подтверждённые users/revenue для LM Studio Bionic и Msty в собранном анализе не найдены.
  • Технические выводы о moat, capture risk, enterprise requirements и монетизации являются аналитической оценкой на основе собранных фактов, а не подтверждёнными заявлениями участников рынка.
  • Заявления о качестве Maya-S/S24/M/L, скорости и поддержке AMD/Windows взяты из README и не были независимо воспроизведены.
  • Лицензия GLM-5.3-Flash как MIT указана в README; отдельная независимая юридическая проверка лицензий модели, quants и зависимостей не проводилась.
ИСТОЧНИКИ (38)

Why This Is A Finding

mw00/project-maya собрал 75 звёзд за окно, тогда как у автора всего 5 подписчиков — эффективная аудитория ≈ 27. Это даёт surprise-индекс 1.11 (звёзды относительно охвата автора, а не в абсолюте). Удержание форков 0.0% и 0 внешних контрибьюторов отделяют реальный инструмент от разовой вспышки. Акселерация положительная — рост ещё не выдохся.

METRICS IN CONTEXT

MEDIAN ACROSS ALL 6158 FINDINGS · Δ vs MEDIAN · PERCENTILE = SHARE RANKED BELOW
METRICVALUEMEDIANΔ MEDPERCENTILE
SCORE1.920.00+1.91ABOVE 100%
VELOCITY75.009.00+66.00ABOVE 94%
RETENTION0.0%0.0%0.0 PPABOVE 0%
FORKS35395-360ABOVE 14%
SURPRISE1.110.01+1.11ABOVE 100%