0d3e40f797
- Single URL to PDF via Puppeteer (Chrome headless) - Doc Site Crawler: crawl entire documentation sites - Auto-extract all pages from TOC navigation - 20-page batch processing with browser restart (anti-OOM) - Output: PDF + Markdown - Flask-style HTTP server on port 8099 - Deployed at https://pdf.donton.cloud/url2pdf
10 lines
371 B
JavaScript
10 lines
371 B
JavaScript
const puppeteer = require("puppeteer");
|
|
(async () => {
|
|
const browser = await puppeteer.launch({headless: true, args: ["--no-sandbox"]});
|
|
const page = await browser.newPage();
|
|
await page.goto(process.argv[2], {waitUntil: "networkidle2", timeout: 30000});
|
|
await page.pdf({path: "/tmp/page.pdf", format: "A4"});
|
|
await browser.close();
|
|
console.log("done");
|
|
})();
|