JailbrokenAI/wallbreaker
wallbreaker là một AI red-teaming / jailbreak testing tool viết bằng Python, tập trung tạo và đánh giá prompt tấn công để kiểm tra mức độ an toàn của mô hình ngôn ngữ. Với ~572 sao, dự án phù hợp hơn…
Kết luận: partial · Công nghệ: python · llm-security · prompt-injection · red-teaming · ai-safety
wallbreaker là một AI red-teaming / jailbreak testing tool viết bằng Python, tập trung tạo và đánh giá prompt tấn công để kiểm tra mức độ an toàn của mô hình ngôn ngữ. Với ~572 sao, dự án phù hợp hơn cho mục đích nghiên cứu bảo mật AI, kiểm thử guardrail và benchmarking hành vi model hơn là dùng như thành phần sản phẩm trực tiếp.
📖 Giới thiệu chi tiết
🧩 Nó là gì?
JailbrokenAI/wallbreaker là một công cụ dòng lệnh viết bằng Python để red-team AI: kiểm thử xem mô hình ngôn ngữ có dễ bị “jailbreak” hay vượt qua lớp an toàn hay không. Bạn có thể hiểu nó như một “phòng thử nghiệm” để tạo, chạy và đánh giá các prompt tấn công trong môi trường kiểm thử có kiểm soát.
🎯 Giải quyết vấn đề gì? Dành cho ai?
Các mô hình AI thường có guardrail, tức là lớp bảo vệ giúp từ chối yêu cầu nguy hiểm hoặc không phù hợp. Vấn đề là guardrail không phải lúc nào cũng chắc chắn, nên đội bảo mật cần cách kiểm tra có hệ thống thay vì thử vài prompt thủ công.
wallbreaker phù hợp với:
- Nhà nghiên cứu bảo mật AI muốn đo mức độ an toàn của LLM.
- Đội red-team / blue-team kiểm thử guardrail trước khi triển khai model.
- Người làm benchmark muốn so sánh hành vi nhiều model bằng cùng một bộ bài test.
- Kỹ sư AI muốn hiểu model phản ứng ra sao trước prompt phức tạp, biến đổi hoặc nhiều lượt.
Không nên xem wallbreaker là thư viện để nhúng thẳng vào sản phẩm người dùng cuối. Nó thiên về nghiên cứu, kiểm thử và đánh giá bảo mật có ủy quyền.
⚙️ Hoạt động ra sao?
- Bạn cấu hình 3 vai trò chính:
profiles: “bộ não tấn công”, tức model/agent dùng để nghĩ cách kiểm thử.[target]: model bị kiểm thử.[judge]: model hoặc bộ đánh giá dùng để chấm phản hồi của target.
- Bạn chạy
wallbreakertrong terminal, tương tác kiểu TUI giống Claude Code. - Công cụ có thể tự lặp: tạo prompt → gửi vào target → đọc phản hồi → sửa chiến thuật → thử lại.
- Nó hỗ trợ nhiều backend như OpenRouter, Z.AI GLM coding plan, local Claude Code CLI, local server, hoặc API tương thích OpenAI/Anthropic.
- Nó có sẵn nhiều bộ công cụ kiểm thử:
HarmBench: bộ benchmark gồm nhiều hành vi để test công bằng hơn.ParseltonguevàP4RS3LT0NGV3: biến đổi prompt bằng encoding, ký tự đặc biệt, steganography, homoglyph, zero-width...L1B3RT4S: thư viện jailbreak prompt.PAIR/TAP,Crescendo,best_of_n: các vòng tấn công tự động.validate: chạy lại nhiều lần để đo tỷ lệ thành công thật, tránh kết luận từ một lần may mắn.
- Với TUI, phiên làm việc được autosave vào
sessions/autosave.json, nên có thể dùngwallbreaker --resumeđể mở lại.
🆚 Khi nào nên dùng / không nên
Nên dùng wallbreaker khi:
- Bạn cần kiểm thử an toàn model một cách có cấu trúc.
- Bạn muốn so sánh nhiều model, nhiều backend hoặc nhiều chiến thuật jailbreak.
- Bạn cần benchmark bằng bộ test chuẩn như
HarmBench. - Bạn muốn kiểm tra lại kết quả nhiều lần bằng
validatethay vì tin vào một lần chạy.
Không nên dùng khi:
- Bạn chỉ cần gọi LLM bình thường trong app; khi đó SDK OpenAI/Anthropic hoặc framework như LangChain sẽ phù hợp hơn.
- Bạn không có quyền kiểm thử model/hệ thống mục tiêu.
- Bạn cần một công cụ production ổn định để phục vụ người dùng cuối.
- Bạn chưa có quy trình xử lý dữ liệu nhạy cảm, log, API key và kết quả kiểm thử.
So với việc tự viết script gửi prompt thủ công, wallbreaker mạnh hơn vì có sẵn vòng lặp tấn công, bộ biến đổi prompt, benchmark, judge và cơ chế validate. Đổi lại, nó phức tạp hơn và cần cấu hình cẩn thận.
🚀 Bắt đầu nhanh
Cài đặt repo:
git clone https://github.com/JailbrokenAI/wallbreaker
cd wallbreaker
python -m venv .venv
. .venv/bin/activate
pip install -e ".[dev]"
Tạo file cấu hình:
cp config.example.toml config.toml
Mở config.toml và điền API key/model. Ví dụ tối thiểu:
default_profile = "glm"
[profiles.glm]
protocol = "openai"
base_url = "https://api.z.ai/api/paas/v4"
api_key = "..."
model = "glm-4.6"
[target]
protocol = "openai"
base_url = "https://openrouter.ai/api/v1"
api_key = «bí mật đã ẩn»
model = "deepseek/deepseek-v4-pro"
[judge]
protocol = "openai"
base_url = "https://openrouter.ai/api/v1"
api_key = «bí mật đã ẩn»
model = "openai/gpt-4o-mini"
Kiểm tra cấu hình:
wallbreaker check
Chạy giao diện terminal:
wallbreaker
Chạy một lượt tự động với mục tiêu kiểm thử:
wallbreaker --auto "objective..."
Một vài lệnh hay dùng trong TUI:
/target anthropic/claude-3.7-sonnet
/provider WandB
/sysprompt test
/validate <task>
/tools
Nếu muốn dùng bộ P4RS3LT0NGV3 đầy đủ:
wallbreaker parsel update
wallbreaker parsel list
✅ Điểm mạnh & ⚠️ Hạn chế
Điểm mạnh:
- Hỗ trợ nhiều provider và API tương thích OpenAI/Anthropic, nên dễ thử trên nhiều model.
- Có vòng lặp tấn công tự động, giúp giảm công thử prompt thủ công.
- Dùng
HarmBenchđể benchmark có hệ thống hơn. - Có
validateđể đo độ ổn định của kết quả, không chỉ dựa vào một lần “thành công”. - Bộ công cụ phong phú:
Parseltongue,P4RS3LT0NGV3,L1B3RT4S,PAIR/TAP,Crescendo,best_of_n,many_shot,prefill. - Có thể autosave và resume phiên làm việc.
Hạn chế:
- Cần hiểu rõ mục tiêu kiểm thử và cấu hình model/API key trước khi dùng hiệu quả.
- Không phù hợp để nhúng trực tiếp vào sản phẩm production.
- Một số tính năng nâng cao như
P4RS3LT0NGV3cần thêm Node.js hoặc setup phụ. - Kết quả jailbreak có thể dao động theo model, provider, seed, timeout và backend.
- Vì là công cụ red-team, chỉ nên dùng cho kiểm thử bảo mật có ủy quyền.