From 83b1653b13073ba220e9836d46fa0054d7ee65c3 Mon Sep 17 00:00:00 2001 From: Kris Yotam <75515498+krisyotam@users.noreply.github.com> Date: Sun, 12 Apr 2026 11:20:51 -0500 Subject: [PATCH] add README.md --- README.md | 47 +++++++++++++++++++++++++++++++++++++++++++++++ 1 file changed, 47 insertions(+) create mode 100644 README.md diff --git a/README.md b/README.md new file mode 100644 index 0000000000000000000000000000000000000000..5ccc35128e3c9db3a159ac9a01a25d5d0e0923e3 --- /dev/null +++ b/README.md @@ -0,0 +1,47 @@ +# sparser + +Simple URL extractor from text files. Suckless C tool. + +sparser scans files for external URLs and prints them to stdout, one per line. It handles HTML, Markdown, MDX, and plain text. Optionally recurses directories and deduplicates output. + +## Usage + +``` +sparser [-vuR] [path | -] + + -v verbose (print filenames to stderr) + -u deduplicate URLs + -R recursive directory scan + + path file or directory to scan + - read from stdin +``` + +## Examples + +```sh +# Extract URLs from a single file +sparser notes.md + +# Recursively scan a directory, deduplicate +sparser -uR ~/documents/ + +# Pipe from stdin +curl -s https://example.com | sparser - +``` + +## Configuration + +Edit `config.h` to adjust file size limits, max URL length, and line buffer size. + +## Requirements + +A C compiler and POSIX headers. + +## Installation + +Edit `config.mk` to match your local setup, then: + +```sh +make clean install +```