极客前沿

5 分钟入门:用住宅代理爬取网站(Node.js & Python)

2026-07-20 01:31
DEV Tutorial
查看原文

零基础学会安装代理 SDK、配置环境、运行代码,第一次成功爬取网站。

准备环境

你需要安装 Node.js(一个让 JavaScript 在电脑上运行的工具)或 Python(另一种编程语言)。如果还没装:去官网下载安装包,一路默认安装即可。同时需要一个代码编辑器,比如 VS Code。

安装代理 SDK

我们使用 Aethyn SDK(一个帮你快速构建代理连接的代码库)。打开终端(命令行),运行以下命令之一:

  • Node.js:npm install proxy-builder-sdk
  • Python:pip install proxy-builder-sdk

等待安装完成,没有报错就是成功。

配置并运行第一个爬虫

创建一个新文件(比如 scrape.jsscrape.py),复制下面的代码:

Node.js 版本:

Tutorial Image
const { ProxyBuilder } = require('proxy-builder-sdk');
const pb = new ProxyBuilder({ username: '你的用户名', password: '你的密码' });
const proxy = pb.proxy(); // 每次请求换 IP
const response = await fetch('https://api.ipify.org?format=json', { proxy });
const data = await response.json();
console.log(data); // 打印你的出口 IP

Python 版本:

from proxy_builder_sdk import ProxyBuilder
pb = ProxyBuilder(username='你的用户名', password='你的密码')
proxy = pb.proxy()  # 每次请求换 IP
import requests
response = requests.get('https://api.ipify.org?format=json', proxies=proxy)
print(response.json())  # 打印你的出口 IP

你的用户名你的密码 换成你在 Aethyn 注册后获得的凭证(格式类似 aethyn-xxxxx)。也可以设置环境变量 AETHYN_USERNAMEAETHYN_PASSWORD,代码会自动读取。

运行文件:node scrape.jspython scrape.py。如果看到一串 JSON 输出(比如 {"ip": "123.45.67.89"}),就说明成功了!

下一步:爬取真正的网站

把上面的 URL 换成你想爬的网站(比如 https://example.com),然后加上解析逻辑即可。注意:robots.txt(网站告诉爬虫哪些页面可以访问的文件)和 速率限制(网站限制请求频率的机制)要遵守,只爬取公开数据。如果遇到 403 或 429 错误,换一个代理 IP 再试——proxy() 会自动轮换 IP。

新用户注册 Aethyn 会获得免费流量,无需绑定信用卡,可以零成本跑通以上所有代码。更多文档见 aethyn.io/sdk。

内容来源

DEV Tutorial

发布时间

2026-07-20 01:31

返回 AI技术