Usando proxies em Python com httpx
httpx e proxies
O httpx é uma biblioteca HTTP moderna para Python que suporta os modos síncrono e assíncrono de operação. Uma vantagem essencial é o suporte nativo a HTTP/2 e a proxies SOCKS sem bibliotecas adicionais.
Instalação
pip install httpx
# Para suporte a SOCKS:
pip install httpx[socks]
# Para HTTP/2:
pip install httpx[http2]
Modo síncrono
Proxy HTTP
import httpx
proxy = "http://user:pass@proxy_ip:port"
response = httpx.get("https://httpbin.org/ip", proxy=proxy)
print(response.json())
Proxies diferentes para HTTP e HTTPS
proxies = {
"http://": "http://proxy1:port",
"https://": "http://proxy2:port",
}
with httpx.Client(proxy=proxies) as client:
response = client.get("https://httpbin.org/ip")
print(response.json())
Proxy SOCKS5
import httpx
proxy = "socks5://user:pass@proxy_ip:port"
with httpx.Client(proxy=proxy) as client:
response = client.get("https://httpbin.org/ip")
print(response.json())
Modo assíncrono
Exemplo básico
import httpx
import asyncio
async def fetch():
proxy = "http://user:pass@proxy_ip:port"
async with httpx.AsyncClient(proxy=proxy) as client:
response = await client.get("https://httpbin.org/ip")
print(response.json())
asyncio.run(fetch())
Requisições paralelas
import httpx
import asyncio
async def fetch_url(client, url):
try:
response = await client.get(url, timeout=10)
return response.text
except Exception as e:
return None
async def main():
proxy = "http://user:pass@proxy_ip:port"
urls = [f"https://example.com/page/{i}" for i in range(50)]
async with httpx.AsyncClient(proxy=proxy) as client:
tasks = [fetch_url(client, url) for url in urls]
results = await asyncio.gather(*tasks)
success = sum(1 for r in results if r)
print(f"Success: {success}/{len(urls)}")
asyncio.run(main())
HTTP/2 via proxy
O httpx é uma das poucas bibliotecas Python com suporte a HTTP/2:
import httpx
proxy = "http://user:pass@proxy_ip:port"
with httpx.Client(proxy=proxy, http2=True) as client:
response = client.get("https://httpbin.org/ip")
print(f"HTTP version: {response.http_version}")
print(response.json())
O HTTP/2 via proxy funciona pelo método CONNECT — o proxy cria um túnel TCP através do qual é estabelecida a conexão HTTP/2 com o servidor.
Rotação de proxies
import httpx
import random
PROXIES = [
"http://user:pass@proxy1:port",
"http://user:pass@proxy2:port",
"http://user:pass@proxy3:port",
]
def get_random_proxy():
return random.choice(PROXIES)
# Rotação síncrona
for i in range(10):
proxy = get_random_proxy()
with httpx.Client(proxy=proxy) as client:
resp = client.get("https://httpbin.org/ip")
print(resp.json())
Rotação assíncrona
import httpx
import asyncio
import random
PROXIES = [
"http://user:pass@proxy1:port",
"http://user:pass@proxy2:port",
"http://user:pass@proxy3:port",
]
async def fetch_with_rotation(url):
proxy = random.choice(PROXIES)
async with httpx.AsyncClient(proxy=proxy) as client:
try:
resp = await client.get(url, timeout=10)
return resp.text
except Exception:
return None
async def main():
urls = ["https://example.com"] * 20
tasks = [fetch_with_rotation(url) for url in urls]
results = await asyncio.gather(*tasks)
print(f"Success: {sum(1 for r in results if r)}")
asyncio.run(main())
Configuração do cliente
Timeout
timeout = httpx.Timeout(
connect=5.0, # conexão com o proxy e o servidor
read=10.0, # leitura da resposta
write=5.0, # envio da requisição
pool=5.0 # espera no pool de conexões
)
client = httpx.Client(proxy=proxy, timeout=timeout)
Cabeçalhos e cookies
headers = {
"User-Agent": "Mozilla/5.0 ...",
"Accept-Language": "en-US,en;q=0.9",
}
client = httpx.Client(
proxy=proxy,
headers=headers,
follow_redirects=True,
max_redirects=10
)
Pool de conexões
limits = httpx.Limits(
max_connections=100, # total de conexões
max_keepalive_connections=20 # conexões keep-alive
)
client = httpx.AsyncClient(proxy=proxy, limits=limits)
Tratamento de erros
import httpx
async def safe_fetch(client, url):
try:
response = await client.get(url)
response.raise_for_status()
return response.text
except httpx.ProxyError as e:
print(f"Proxy error: {e}")
except httpx.ConnectTimeout:
print("Connection timeout")
except httpx.ReadTimeout:
print("Read timeout")
except httpx.HTTPStatusError as e:
print(f"HTTP {e.response.status_code}")
except httpx.RequestError as e:
print(f"Request error: {e}")
return None
httpx vs requests vs aiohttp
| Parâmetro | httpx | requests | aiohttp |
|---|---|---|---|
| Síncrono | Sim | Sim | Não |
| Assíncrono | Sim | Não | Sim |
| HTTP/2 | Sim | Não | Não |
| SOCKS | Sim (nativo) | Via requests-socks | Via aiohttp-socks |
| Proxy na URL | Sim | Sim | Sim |
| API | compatível com requests | Padrão | Própria |
| Desempenho | Alto | Médio | Alto |
Migração a partir do requests
O httpx foi projetado como substituto direto do requests. A migração é mínima:
# requests
import requests
resp = requests.get(url, proxies={"https": proxy})
# httpx
import httpx
resp = httpx.get(url, proxy=proxy)
A principal diferença: no httpx usa-se o parâmetro proxy (no singular) em vez de proxies.
Conclusão
O httpx é a melhor escolha para novos projetos Python que precisam de proxies. O suporte nativo a HTTP/2, SOCKS5 e aos modos síncrono e assíncrono faz dele uma ferramenta versátil. A API compatível com requests simplifica a migração de projetos já existentes.
