webclaw的5大输出格式详解:markdown/llm/text/json/html怎么选?llm格式省67%token的秘密

发布时间:2026/10/4 14:13:30
webclaw的5大输出格式详解:markdown/llm/text/json/html怎么选?llm格式省67%token的秘密 webclaw的5大输出格式详解markdown/llm/text/json/html怎么选llm格式省67%token的秘密【免费下载链接】webclawFast, local-first web content extraction for LLMs. Scrape, crawl, extract structured data — all from Rust. CLI, REST API, and MCP server.项目地址: https://gitcode.com/gh_mirrors/web/webclawwebclaw是一个用 Rust 编写的本地优先网页内容提取工具输入一个 URL输出给 LLM 用的干净内容。它支持 CLI、REST API 和 MCP 服务其中--format简写-f参数提供5 种输出格式markdown、llm、text、json、html。选错格式你的 token 账单和下游管道都会受伤。这篇文章带你一次选对。 5种格式一张表速览格式输出内容典型用途相对 raw HTML 的 token 消耗markdown默认带标题、列表、链接的干净 markdown人类阅读、RAG 入库前检查中llm高密度纯文本 元信息头 去重链接区直接喂给 LLM 做问答/摘要/嵌入最低约省 67%text无任何格式标记的纯文本全文检索、词频统计、简单管道中低json结构化数据元数据、正文、链接、图片、代码块程序化消费、diff 对比、API 集成高信息最全html提取后内容再消毒得到的 HTML保留版式、二次渲染高一句话记忆人看用 markdown模型看用 llm程序吃用 json。✍️ markdown默认格式人类友好webclaw https://example.com --format markdown不带-f时默认就是markdown。输出保留# 标题、列表、链接和代码块噪音导航、脚本、样式、广告已被剔除。适合把网页转成笔记或文档可配合--only-main-content只留正文作为 RAG 语料前的人工抽检RAG 场景的完整工作流可以参考 examples/html-to-markdown-rag/README.md。 llm给大模型的压缩粮省 67% token 的秘密webclaw https://docs.anthropic.com -f llmllm格式由一套9 步文本优化流水线生成见 CHANGELOG.md相比 raw HTML平均减少 67% 的 token。它的输出固定为三段式实现见 crates/webclaw-core/src/llm/mod.rs紧凑元信息头前缀的标题、作者、发布时间等几行搞定清洗后的正文剥离装饰性图片、加粗/斜体等视觉格式正文中的链接 URL 全部移出链接本身退化为纯文本去重链接区所有链接统一放到文末的## Links区块同一条链接只出现一次。省 token 的三个关键动作链接去重网页里大量了解更多重复指向同一 URLllm 格式只保留一次格式符剥离**、*、alt这些符号对模型理解正文几乎无用但按字计算很占 token噪音过滤分页残留、JSON-LD 重复正文、框架注水数据如 Next.js 水合 blob在进入上下文前就被清掉。 验证神器webclaw bench url子命令crates/webclaw-cli/src/bench.rs会对单个 URL 输出raw HTML tokens vs llm 输出 tokens的对比表--json可导出单行 JSON 方便接入 CI。实测很多站点 raw 字节能砍掉 90% 以上。 text最朴素的纯文本webclaw https://example.com -f text | wc -w无任何 markdown 标记连表格分隔线的|也会去掉。适合词数统计、正则匹配、喂给只认纯文本的旧管道。如果你需要干净字符串而不需要结构用它比 markdown 更轻。 json程序集成的标准答案webclaw https://example.com -f json | jq -r .metadata.titlejson格式输出完整ExtractionResult类型定义见 crates/webclaw-core/src/types.rsmetadata标题/描述/作者/字数、contentmarkdown、plain_text、links、images、code_blocks、structured_dataJSON-LD。三大典型用法变更监控今天存一份快照明天--diff-with snapshot.json对比配方见 examples/README.md取结构化字段图片列表、外链列表用jq一行取出与自托管 REST API 对接crates/webclaw-server/ 的/v1/scrape等端点返回同样的 JSON 结构。 html提取后的消毒 HTMLwebclaw --raw-html https://example.com raw.html-f html返回的是内容提取后再消毒的 HTML保留了版面结构适合需要二次渲染或注入到其他模板的场景。注意它和--raw-html未提取的原始抓取 HTML用于调试不是一回事。 怎么选30 秒决策清单你的下一步动作选它直接塞进 prompt / 做摘要 / 做嵌入 / 分块llm人要打开看一眼、归档为文档markdown写代码解析、存库、diff 对比json纯文本检索、计数、老系统管道text需要保留页面结构再渲染html批量处理时同样适用webclaw --urls-file urls.txt -f llm corpus.txt一行就能把整站文档压成 token 友好的语料。 延伸阅读仓库内示例命令大全examples/README.mdRAG 管道实践examples/html-to-markdown-rag/README.md提取基准测试方法benchmarks/methodology.md中文项目说明README_zh-CN.md记住一句话把网页喂给模型之前先问自己——模型需要的是页面还是信息。只要信息就用llm格式让 67% 的 token 留在账单之外。【免费下载链接】webclawFast, local-first web content extraction for LLMs. Scrape, crawl, extract structured data — all from Rust. CLI, REST API, and MCP server.项目地址: https://gitcode.com/gh_mirrors/web/webclaw创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考