做过网页抓取的开发者都清楚,真正消耗时间的不是发送HTTP请求,而是处理验证码、反爬机制、JS渲染、页面结构变化、代理轮换这些后续工作。Bright Data CLI 把这套分散的流程收进终端命令里,让开发者用几条命令完成抓取、搜索、结构化提取和浏览器控制。

用我的专属链接注册,新用户注册可获得免费试用额度(当前活动可领取 5,000 次请求),具体额度以官方页面为准 → https://get.brightdata.com/97nfmevgx011?utm_content=CLI-developer

想快速体验 Bright Data CLI?现在通过专属注册链接即可领取免费试用额度,无需自行搭建代理、浏览器环境,即可开始抓取网页数据。
立即免费体验 Bright Data CLI → https://get.brightdata.com/97nfmevgx011?utm_content=CLI-developer

Bright Data 是 Bright Data 的官方命令行工具,安装后通过 brightdata 命令调用 scrape、search、pipelines、browser、scraper 等能力。对后端、数据工程和 AI 开发场景来说,它的核心价值在于把网页数据获取变成可脚本化、可复用、可接入 CI/CD 和 Agent 的标准流程。

项目地址:https://github.com/brightdata/cli

image.png

安装与配置

新用户注册可获得免费试用额度(当前活动可领取 5,000 次请求),具体额度以官方页面为准:

https://get.brightdata.com/97nfmevgx011?utm_content=CLI-developer

登录后在右上角能看到免费额度显示,这个设计挺直观的,一眼就能看到剩余次数。进入设置页面获取 API Key,这个 Key 后续登录和认证都要用到:

image.png

image.png

安装过程很简单,基于 npm 全局安装就行:

npm install -g @brightdata/cli

装完之后先确认一下版本,确保安装成功:

brightdata --version

image.png

登录的时候直接用 API Key 就行,不需要额外配置什么环境变量或者配置文件,这一点比很多 CLI 工具做得好:

brightdata login --api-key YOUR_API_KEY

image.png

登录成功后建议跑一遍完整的检查流程,确认网络连通性和账户状态都没问题。我一般会按顺序执行这三条命令:先看配置信息,再查余额,最后用百度做个快速测试:

# 检查配置
brightdata config

# 验证API连接和余额
brightdata budget

# 快速测试抓取
brightdata scrape https://baidu.com

image.png

到这里整个环境就配好了,接下来可以开始实际测试各个功能。

完成安装后,你可以立即体验网页抓取、SERP 搜索、AI 内容发现等功能。免费额度足够完成大多数测试和学习项目。
领取免费试用额度 → https://get.brightdata.com/97nfmevgx011?utm_content=CLI-developer

核心功能演示

1. 页面抓取(scrape)

Bright Data CLI 的 scrape 命令用于快速抓取网页内容,可自动处理 JavaScript 渲染、反爬策略,并支持 HTML、Markdown、JSON 等多种输出格式。

scrape 是最基础也是最常用的命令。我先拿两个简单页面测试一下,一个是 GitHub 的 README 文件,另一个是 Hacker News 首页:

# 抓取GitHub README并保存为Markdown
brightdata scrape https://github.com/brightdata/cli/blob/main/README.md -o github-readme.md

# 抓取Hacker News首页保存为HTML
brightdata scrape https://news.ycombinator.com -f html -o hn.html

image.png

从输出结果看,Markdown 格式的输出质量不错,代码块、标题、列表这些格式都保留了。Hacker News 那个 HTML 输出完整保存了页面结构,后续如果需要做进一步解析也很方便。

接下来我试了个更有挑战性的目标——LinkedIn 公司主页。这种页面有几个难点:需要 JS 渲染才能看到内容,有比较严格的反爬机制,不同地区返回的内容可能不一样。我用美国节点 + JSON 格式输出跑了一下:

brightdata scrape https://www.linkedin.com/company/microsoft/ --country us -f json -o linkedin-company.json

image.png

这次返回的是 JSON 数据,里面包含了公司名称、员工数、行业分类这些结构化字段。说实话这个功能比我预期的要好,之前用自写爬虫处理 LinkedIn 这种站点,光反爬这一块就得折腾很久。

2. 搜索引擎结果获取(search)

search 这个命令我一开始没太重视,实际用了之后发现确实实用。search 命令底层调用的是 Bright Data SERP API,可直接获取 Google、Bing 等搜索引擎的结构化搜索结果,无需自行解析搜索页面。

先测了 Google 新闻搜索,关键词选的 “AI regulation”,指定美国地区和英文结果:

brightdata search "AI regulation" --type news --country us --language en -o news.json

image.png

返回的数据里每个结果都有标题、链接、来源网站、发布时间这些字段,格式很规整。我又换了 Bing 引擎搜了下自己的产品关键词,看看市面上怎么定价的:

brightdata search "bright data pricing" --engine bing -o bing-search.json

image.png

两个搜索引擎的结果格式基本一致,切换起来很方便。这个功能在做竞品调研或者舆情监控的时候应该能省不少事。

3. AI内容发现(discover)

discover 是个比较新的功能,它的定位跟普通搜索不太一样。**Discover API 专门面向 AI Agent 与 LLM 应用,可实时发现高质量网页内容,并返回适合 AI 使用的结构化结果。**普通搜索返回的是网页链接,而 discover 会根据你的意图描述,去找相关度更高的权威来源,并且可以直接把内容正文也返回来。

我输入了一个比较泛的话题 “AI trends”,然后加了一段意图描述让它优先找研究报告和分析类的内容:

brightdata discover "AI trends" --intent "Prioritize authoritative research and industry analysis" --include-content --num-results 5 --pretty -o discover.json

image.png

输出结果里每个条目不仅有来源链接,还带了摘要和部分正文内容。对于需要快速了解某个领域概况的场景,这个功能比传统搜索效率高不少。

4. 平台结构化数据提取(pipelines)

Pipelines 提供预构建的数据提取模板,可直接返回结构化 JSON,而无需自行编写解析规则。

pipelines 是我觉得最实用的功能之一。它针对特定平台做了预置的数据提取规则,你只需要告诉它你要抓哪个平台的哪种数据,它就直接返回结构化的 JSON。

先看看支持哪些平台:

brightdata pipelines list

列出来的平台确实多,GitHub、LinkedIn、Amazon、Twitter、Instagram 这些主流平台都覆盖到了,大概有 40 多个。

我挑了两个实际测了一下。第一个是从 GitHub 仓库提取文件信息,第二个是从 LinkedIn 提取公司资料:

# 提取GitHub仓库文件信息
brightdata pipelines github_repository_file "https://github.com/brightdata/cli/blob/main/README.md" --pretty -o github-readme.json

# 提取LinkedIn公司资料
brightdata pipelines linkedin_company_profile "https://www.linkedin.com/company/microsoft/" --pretty -o linkedin-company.json

image.png

对比之下能看出来 pipelines 和 scrape 的区别:scrape 返回的是原始页面内容的格式转换,而 pipelines 返回的是经过清洗和字段化的结构化数据。如果你明确知道要抓哪个平台的哪类信息,用 pipelines 更省心。

如果你的目标是获取 LinkedIn、Amazon 等网站的结构化数据,不妨直接体验 Pipelines,无需编写解析规则即可获得 JSON 数据。
体验结构化数据采集 → https://get.brightdata.com/97nfmevgx011?utm_content=CLI-developer

5. AI自动生成爬虫(scraper)

Scraper 可根据自然语言描述自动生成网页提取规则,大幅降低开发门槛。

这个功能是我测试下来觉得最有意思的。scraper create 可以用自然语言描述你的需求,然后由 AI 自动生成一个针对性的爬虫。

我给它的指令是提取 GitHub 仓库的基本信息和 README 内容:

# 创建爬虫
brightdata scraper create https://github.com/brightdata/cli "提取仓库名称、简介、star数和README内容" --pretty -o scraper-create.json

image.png

它会先分析目标页面的结构,然后根据你的需求描述自动生成提取规则。创建完成后会返回一个 collector_id,之后就可以用这个 ID 来批量运行爬虫了:

# 运行爬虫
brightdata scraper run <collector_id> https://github.com/brightdata/cli --pretty -o scraper-run.json

这个功能的价值在于,当你需要长期监控某个类型页面但又不想手写选择器的时候,可以让 AI 帮你搞定初始版本,后续微调就行了。

对比传统方案

为了直观展示 Bright Data CLI 相比传统方式的优势,我特意做了一个对比测试。

之前我用 Python 或者 curl 直接调 Bright Data API 的时候,API 返回的只是一个任务 ID:

image.png

要拿到实际数据,还得把这个 ID 复制到 Bright Data 控制台里手动查询:

image.png

这个过程说实话挺烦人的,尤其是批量跑任务的时候,每个 ID 都要去查一次。而且如果你忘了存 ID,那就更麻烦了。

换成 Bright Data CLI 之后,整个过程就顺畅多了。命令执行完直接把结果写到本地文件里:

image.png

JSON 文件打开就能看,配合 VSCode 的 JSON 格式化插件或者在线 JSON 查看器,数据结构一目了然。

整理了一下三种方案的对比:

特性Bright Data CLIPython自写爬虫curl/wget
反封禁处理内置代理池+指纹管理手动配置无
CAPTCHA处理自动识别解决集成第三方服务无
JS渲染支持内置无头浏览器需集成Selenium/Playwright无
结构化输出原生JSON/Markdown手动解析HTML原始HTML
启动配置零配置,即装即用需搭建完整技术栈仅基础HTTP
AI能力自然语言生成爬虫需自行接入LLM无

从表格能看出来,Bright Data CLI 在易用性上优势明显。Python 方案虽然灵活,但前期搭建成本高,后期维护也不轻松。curl/wget 只能用于最简单的场景,稍微复杂点的页面就搞不定了。
用我的专属链接注册,新用户注册可获得免费试用额度(当前活动可领取 5,000 次请求),具体额度以官方页面为准 → https://get.brightdata.com/97nfmevgx011?utm_content=CLI-developer

进阶功能与集成

Bright Data CLI 还有一个技能系统,可以通过 skill list 查看当前已安装的功能模块:

brightdata skill list

image.png

如果需要额外的功能可以用 skill add 来安装,比如我加装了 scrape 技能的扩展包:

brightdata skill add scrape

image.png

另外一个值得提的功能是 MCP 集成。现在很多 AI 开发工具(Claude Code、Cursor、Codex)都支持 MCP 协议,Bright Data MCP 提供免费使用,可快速让 Claude、Cursor、Codex 等 AI Agent 获得实时网页访问能力。 Bright Data CLI 可以直接作为 MCP Server 接入进去:

brightdata add mcp --agent codex --global

image.png

这意味着你在 AI 编程助手里也能直接调用 Bright Data CLI 的能力,让 Agent 自己去抓取网页数据。对于正在做 AI 应用开发的团队来说,这个集成点挺重要的。

正在开发 AI Agent?可以将 Bright Data MCP 接入 Claude、Cursor 或 Codex,让 AI 获得实时网页访问能力。
免费体验 Bright Data MCP → https://get.brightdata.com/97nfmevgx011?utm_content=CLI-developer

使用场景

根据我这段时间的使用体验,总结几个比较实用的场景:

电商价格监控:定时抓取 Amazon、京东等平台商品价格,构建价格变动数据库。用 scrape 或 pipelines 就能实现,配合 cron 定时任务就能跑起来。

销售线索获取:从 LinkedIn 公开主页批量提取公司信息和决策人资料。pipelines 的 LinkedIn 相关模板已经做好了字段映射,省得自己去分析页面结构。

市场趋势分析:通过搜索引擎结果监测竞品动态和行业关键词热度。search 命令拿到的结构化数据可以直接导入数据分析工具。

AI Agent 数据供给:为 Agent 工作流注入实时网页数据,支持 MCP 协议对接。这个是最近才用起来的,感觉潜力很大。

研究数据采集:学术研究和市场调研中的大规模公开数据收集。免费额度足够支撑小规模的研究项目。

常见问题

Q:抓取的数据是否合规?
A:仅抓取公开可访问的数据,不涉及登录墙后的私有内容。使用前请遵守目标网站的 robots.txt 和服务条款。

Q:免费额度如何使用?
A:新用户注册可获得免费试用额度(当前活动可领取 5,000 次请求),具体额度以官方页面为准。如需更高权限或企业级功能,联系客户经理开通。

Q:是否支持 CI/CD 集成?
A:支持。所有命令均可写入 Shell 脚本,配合 GitHub Actions、Jenkins 等 CI/CD 工具实现自动化流水线。

Q:有速率限制吗?
A:免费套餐有基本速率限制,付费套餐可根据需求调整。具体限制取决于账户类型和使用的服务。

Q:CLI 是否支持 Puppeteer?
A:不支持。Puppeteer、Playwright、Selenium 应使用 Browser API。

总结

Bright Data CLI 将网页抓取的基础设施封装为终端命令,开发者无需关心代理池管理、验证码处理、浏览器渲染等底层实现。通过 scrape、search、pipelines、browser、scraper 五个核心命令,覆盖了从简单页面抓取到 AI 自动化爬虫生成的完整流程。

从我这几天的实际使用来看,它在启动成本和维护难度上相比传统方案有明显提升。特别是 pipelines 和 scraper 这两个功能,解决了以往需要大量手工编码的问题。

完整测试代码和示例脚本:
https://github.com/kk520879/bright-test

准备开始体验 Bright Data CLI?
现在通过专属注册链接注册,即可领取免费试用额度(当前活动可领取 5,000 次请求),具体额度以官方页面为准。快速体验网页抓取、SERP 搜索、AI 内容发现、结构化数据提取及 MCP 集成等功能。
立即领取免费试用,开始你的第一个 CLI 抓取任务 → https://get.brightdata.com/97nfmevgx011?utm_content=CLI-developer

联系 Bright Data 客户经理,升级试用权限 →

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐