v1.0.0: URL-to-PDF + Doc Site Crawler
- Single URL to PDF via Puppeteer (Chrome headless) - Doc Site Crawler: crawl entire documentation sites - Auto-extract all pages from TOC navigation - 20-page batch processing with browser restart (anti-OOM) - Output: PDF + Markdown - Flask-style HTTP server on port 8099 - Deployed at https://pdf.donton.cloud/url2pdf
This commit is contained in:
@@ -0,0 +1,9 @@
|
||||
|
||||
const puppeteer = require("puppeteer");
|
||||
(async () => {
|
||||
const browser = await puppeteer.launch({headless: true, args: ["--no-sandbox", "--disable-gpu"]});
|
||||
const page = await browser.newPage();
|
||||
await page.goto(process.argv[2], {waitUntil: "networkidle2", timeout: 30000});
|
||||
await page.pdf({path: process.argv[3], format: "A4", printBackground: true});
|
||||
await browser.close();
|
||||
})();
|
||||
Reference in New Issue
Block a user