catalog / Marketing / Sumy — Automatic Text Summarization
PipelineMarketingFree

Sumy — Automatic Text Summarization

Python library with 7 summarization algorithms (LSA, Luhn, Lex Rank, TextRank) for documents and HTML pages.

Installationen73k
⟳ upstream v0.12.0 · updated 5mo ago
Quell-Repository
! Grade B · 75/100 · ReviewSecurity assessment
No compromise signals8capabilities surfaced1known CVE9of 20 OWASP controls clear
External endpoints declaredSuspicious code patternsExternal endpoints declaredExternal endpoints declared
scanned 18d agoosv · gitleaks · opengrep · picklescan + heuristicsfull breakdown in the Security tab ↓

Sumy — Automatic Text Summarization

Sumy is a Python module and CLI for extractive text summarization, implementing seven proven algorithms: LSA, Luhn, Edmundson, Lex Rank, TextRank, SumBasic, and KL-Sum. Works on raw text, HTML, or plain URLs — no LLM required.

Key features

  • 7 summarization algorithms; easily swap to compare quality
  • Supports HTML page input (strips boilerplate automatically)
  • Multi-language support via NLTK tokenizers (30+ languages)
  • CLI for quick prototyping; Python API for pipelines
  • Zero API calls — fully local, no rate limits or cost

Quick start

pip install sumy
# Summarize a URL with LexRank in 5 sentences
sumy lex-rank --url https://en.wikipedia.org/wiki/Artificial_intelligence --sentences 5
from sumy.parsers.html import HtmlParser
from sumy.nlp.tokenizers import Tokenizer
from sumy.summarizers.lex_rank import LexRankSummarizer

parser = HtmlParser.from_url("https://example.com/article", Tokenizer("english"))
summarizer = LexRankSummarizer()
for sentence in summarizer(parser.document, sentences_count=5):
    print(sentence)
npx ai-supply add sumy-text-summarization

Curated mirror of the open-source Sumy (Apache-2.0). Get it from the source.

More from @ai-supply

View profile →
Agent
MetaGPT
Multi-agent framework that assigns GPT roles (PM, engineer, QA) to solve complex software tasks end-to-end.
1.0M
Connector
vLLM
High-throughput, memory-efficient LLM inference engine with PagedAttention and continuous batching.
892k
Connector
Meilisearch
Lightning-fast open-source search engine with typo-tolerance, semantic hybrid search, and sub-50ms response times.
811k
Eval
Weights & Biases (wandb)
ML experiment tracking and visualization — log metrics, hyperparameters, models, and media in real time.
784k