Bot nên chặn là nhóm crawler không mang lại giá trị cho website: scraper cào dữ liệu hung hãn, bot dò lỗ hổng và tấn công, bot giả mạo danh tính, scraper bán lại nội dung, crawler SEO của công cụ mình không dùng và bot spam. Nguyên tắc của TOS là chỉ chặn đúng nhóm bot rác và giữ nguyên toàn bộ bot công cụ tìm kiếm cùng bot AI trả lời, nhờ đó tiết kiệm tài nguyên máy chủ mà không ảnh hưởng thứ hạng SEO hay hiện diện trên câu trả lời AI (GEO).
Cập nhật: 08/2026
- Nên chặn: scraper hung hãn (Bytespider), bot dò lỗ hổng, bot giả mạo hoặc bỏ trống User-Agent, scraper bán dữ liệu, crawler SEO không dùng và bot spam.
- Không hại SEO/GEO: vì chỉ chặn bot rác và giữ toàn bộ Googlebot, Bingbot cùng nhóm bot AI trả lời như ChatGPT-User, PerplexityBot, ClaudeBot.
- Lợi ích chính: tiết kiệm tài nguyên và băng thông, tăng tốc và ổn định website, siết bảo mật, bảo vệ nội dung và làm sạch dữ liệu đo lường.

Vì sao cần chặn một số loại bot?
Cần chặn một số loại bot vì có những nhóm crawler chỉ tiêu tốn tài nguyên, đe dọa bảo mật và sao chép nội dung mà không đóng góp gì cho website. Khác với bot công cụ tìm kiếm hay bot AI trả lời, nhóm bot rác không giúp lập chỉ mục cũng không đưa thương hiệu vào câu trả lời AI. Chúng để lại chi phí ẩn: hàng nghìn request mỗi ngày ngốn băng thông và CPU, các đợt dò quét lỗ hổng đe dọa an toàn hệ thống, và hành vi cào nội dung có thể khiến bài viết bị sao chép hàng loạt.
Khung lợi ích của việc chặn xoay quanh bốn trục: tài nguyên (giảm request rác để máy chủ phục vụ người dùng thật), bảo mật (thu hẹp bề mặt tấn công trước scanner và brute-force), nội dung (hạn chế scraper sao chép bài viết, hình ảnh, dữ liệu) và tốc độ (bớt nghẽn nên trang tải nhanh, ổn định hơn). Trước khi chặn, quản trị viên nên nắm rõ các loại bot website để phân biệt bot cần giữ với bot cần loại. Điểm mấu chốt là chặn phải có chọn lọc: chặn đúng bot rác không hề làm giảm thứ hạng hay hiện diện AI, vì các bot phục vụ SEO và GEO nằm ở nhóm khác và luôn được giữ nguyên.
Top các loại bot/crawler nên chặn
Có bảy nhóm bot nên chặn, từ scraper AI hung hãn tới bot spam. Bảng dưới tóm tắt từng nhóm kèm ví dụ, lý do chặn và mục đích; phần sau bảng phân tích chi tiết.
| Nhóm bot | Ví dụ (bot/UA) | Vì sao nên chặn | Chặn tốt cho việc gì |
|---|---|---|---|
| Scraper AI-training hung hãn | Bytespider (ByteDance/Doubao) | Crawl tần suất cực cao, thường bỏ qua robots.txt, không mang traffic hay trích dẫn | Tiết kiệm tài nguyên, băng thông, giảm tải máy chủ |
| Bot dò lỗ hổng, tấn công | Bot brute-force wp-login.php, dò xmlrpc.php, quét shell, dò .env và .git | Là hành vi tấn công, không phải thu thập hợp pháp | Bảo mật: chống brute-force, giảm nguy cơ bị chiếm site |
| Bot giả mạo hoặc bỏ trống User-Agent | UA gõ sai kiểu Mozlila, UA rỗng, giả danh Googlebot sai dải IP | Gần như luôn là scraper hoặc tấn công cải trang | Chống cào nội dung, lọc lưu lượng rác |
| Scraper cào và bán lại dữ liệu | Omgilibot (Webz.io), Diffbot | Không mang lợi ích, tiêu tốn tài nguyên, nguy cơ nội dung bị sao chép | Bảo vệ nội dung, tiết kiệm tài nguyên |
| Crawler SEO của công cụ không dùng | MJ12bot, DotBot, BLEXBot, PetalBot, MBCrawler, SEBot-WA | Ngốn crawl budget và tài nguyên nhưng không tạo giá trị nếu không dùng công cụ đó | Tiết kiệm crawl budget, log gọn hơn |
| Bot spam | Spam bình luận, spam form, referrer spam, lạm dụng xmlrpc pingback | Tạo rác, làm bẩn dữ liệu, có thể bị lợi dụng DDoS phản xạ | Analytics sạch, giảm spam, giảm tải |
| Bot thu thập ảnh (tùy chọn) | ImagesiftBot (Hive/ImageSift) | Cân nhắc khi muốn bảo vệ bản quyền ảnh khỏi huấn luyện AI | Kiểm soát việc ảnh bị dùng huấn luyện |
1. Scraper AI-training hung hãn, bỏ qua robots.txt
Đây là nhóm ưu tiên chặn hàng đầu vì crawl tần suất cực cao, thường phớt lờ robots.txt và không mang lại lượt truy cập hay trích dẫn cho phần lớn doanh nghiệp. Đại diện tiêu biểu là Bytespider của ByteDance (phục vụ Doubao); với website ngoài hệ sinh thái TikTok hay thị trường Trung Quốc, lượng crawl khổng lồ này hầu như không đổi lấy giá trị nào. Theo dữ liệu TOS quan sát trên hệ thống (8/2026), trước khi chặn, Bytespider tạo khoảng 28.000 request mỗi ngày, tương đương khoảng 13% tổng lưu lượng. Sau khi chặn ở tầng máy chủ và trả về mã 403, Bytespider tự giảm còn khoảng 4.000 request mỗi ngày, đúng với hành vi lùi lại khi bị chặn liên tục, trong khi mọi bot AI có giá trị GEO vẫn được giữ nguyên.
2. Bot dò lỗ hổng và tấn công
Nhóm bot dò lỗ hổng cần chặn vì hành vi của chúng là tấn công, không phải thu thập dữ liệu hợp pháp. Chúng thử brute-force wp-login.php, lạm dụng xmlrpc.php để dò mật khẩu hoặc pingback, quét đường dẫn shell và webshell, dò file cấu hình wp-config cùng các file nhạy cảm .env và .git, và khai thác lỗ hổng plugin. Theo dữ liệu TOS quan sát trên hệ thống (8/2026), hệ thống ghi nhận đều đặn các request POST dò shell và khai thác, tất cả đã bị chặn bằng mã 403. Vì nhóm này không tuân thủ robots.txt, chỉ có thể chặn hiệu quả ở tầng máy chủ hoặc tường lửa ứng dụng web (WAF); chặn đúng giúp thu hẹp bề mặt tấn công và giảm nguy cơ website bị chiếm quyền.
3. Bot giả mạo hoặc bỏ trống User-Agent
Bot khai báo User-Agent giả hoặc để trống gần như luôn là scraper hay công cụ tấn công cải trang, nên thuộc nhóm cần chặn. Dấu hiệu thường gặp gồm chuỗi UA gõ sai kiểu Mozlila để giả Mozilla, UA rỗng hoàn toàn, hoặc UA tự nhận là Googlebot và bot AI nhưng đến từ dải IP không thuộc nhà cung cấp công bố, bởi bot chính danh không cần che giấu danh tính. Nhóm này không xử lý được bằng robots.txt; cách chặn hiệu quả là kết hợp lọc theo User-Agent ở tầng máy chủ hoặc WAF với xác minh IP và reverse DNS, để vừa loại kẻ giả mạo vừa tránh chặn nhầm bot thật bị mạo danh.
4. Scraper cào và bán lại dữ liệu
Scraper chuyên cào nội dung để bán lại hoặc dựng cơ sở dữ liệu thương mại nên chặn vì không đem lại lợi ích cho website bị cào. Ví dụ điển hình là Omgilibot của Webz.io (bán dữ liệu web) và Diffbot (dựng knowledge graph thương mại), bên cạnh các scraper cào bài viết, hình ảnh và dữ liệu sản phẩm. Chúng tiêu tốn tài nguyên và tạo nguy cơ nội dung bị sao chép hàng loạt, nên chặn giúp bảo vệ nội dung và tiết kiệm tài nguyên. Một lưu ý mang tính lựa chọn: nếu muốn dữ liệu của mình góp mặt trong các tập dữ liệu mở dùng chung, có thể cân nhắc giữ lại CCBot; đây là quyết định bản quyền, không phải yêu cầu bắt buộc chặn.
5. Crawler SEO của công cụ mình không dùng
Crawler của các công cụ SEO mà doanh nghiệp không sử dụng nên chặn vì chúng ngốn crawl budget và tài nguyên mà không tạo giá trị. Nhóm này gồm MJ12bot của Majestic, DotBot của Moz, BLEXBot của WebMeUp, PetalBot của Huawei, cùng MBCrawler và SEBot-WA. Cần đặc biệt lưu ý một ngoại lệ quan trọng: hãy giữ lại AhrefsBot và SemrushBot nếu doanh nghiệp đang dùng Ahrefs hoặc Semrush, bởi hai công cụ này cần crawl website thì tính năng audit mới hoạt động. Nói cách khác, chỉ nên chặn crawler của công cụ mình không dùng, không chặn theo phản xạ toàn bộ crawler SEO; chặn đúng phần thừa giúp tiết kiệm crawl budget và giữ log gọn gàng.
6. Bot spam bình luận, form và pingback
Bot spam nên chặn vì chúng tạo rác, làm bẩn dữ liệu và có thể bị lợi dụng để tấn công. Nhóm này gồm bot spam bình luận WordPress, spam form liên hệ, referrer spam và hành vi lạm dụng xmlrpc.php cho pingback; ngoài việc gây nhiễu, cơ chế pingback còn có thể bị khai thác để thực hiện DDoS phản xạ. Cách xử lý hiệu quả thường không nằm ở robots.txt mà ở cấu hình ứng dụng và máy chủ: đóng bình luận và pingback khi không cần, đồng thời chặn trực tiếp wp-comments-post.php và xmlrpc.php ở tầng nginx. Kết quả là dữ liệu analytics sạch hơn, lượng spam giảm mạnh và máy chủ bớt tải.
7. Bot thu thập ảnh cho mô hình thị giác (tùy chọn)
Bot chuyên thu thập ảnh để huấn luyện mô hình thị giác là nhóm chặn theo lựa chọn, không bắt buộc. Ví dụ là ImagesiftBot của Hive và ImageSift. Việc chặn hay giữ phụ thuộc vào quan điểm bản quyền hình ảnh của doanh nghiệp: nếu muốn hạn chế ảnh của mình bị dùng để huấn luyện AI thị giác thì có thể chặn nhóm này, còn nếu không đặt nặng thì giữ lại cũng không gây hại đáng kể. Mục đích của việc chặn ở đây là kiểm soát cách hình ảnh bị sử dụng cho huấn luyện.
Những bot TUYỆT ĐỐI KHÔNG nên chặn
Tuyệt đối không chặn nhóm bot công cụ tìm kiếm và bot AI trả lời, vì đây chính là các bot quyết định thứ hạng SEO và mức độ hiện diện GEO của website. Nguyên tắc chung là đánh giá bot theo giá trị mang lại chứ không theo số lượt, bởi một bot ít lượt như OAI-SearchBot vẫn rất quan trọng với độ hiển thị trên AI.
| Nên giữ | Lý do |
|---|---|
| Googlebot | Phục vụ Google Search và AI Overviews; chặn là rớt chỉ mục, mất thứ hạng |
| Bingbot | Nuôi cả tìm kiếm Bing lẫn Copilot |
| ChatGPT-User, OAI-SearchBot | Bot của OpenAI đưa nội dung vào câu trả lời ChatGPT; chặn là mất hiện diện GEO |
| PerplexityBot, Perplexity-User | Đưa website vào câu trả lời của Perplexity |
| ClaudeBot, Claude-User | Bot của Anthropic phục vụ trích dẫn trong câu trả lời Claude |
| Applebot | Phục vụ Apple Intelligence và Siri |
| meta-externalagent, DuckAssistBot | Phục vụ Meta AI và trợ lý của DuckDuckGo |
| Google-Extended, GPTBot, CCBot | Bot huấn luyện; mặc định nên giữ, chỉ opt-out khi có lý do bản quyền cụ thể |
| AhrefsBot, SemrushBot | Giữ nếu doanh nghiệp dùng hai công cụ này để audit SEO |
| Zalo và Facebook link preview | Tạo bản xem trước đẹp khi chia sẻ liên kết |
Với nhóm bot huấn luyện như Google-Extended, GPTBot và CCBot, mặc định nên giữ vì chặn training không làm mất trích dẫn hiện tại; chỉ nên opt-out khi có lý do bản quyền rõ ràng. Để hiểu vì sao nên ưu tiên giữ, có thể tham khảo cách hoạt động của các crawler AI và thứ tự ưu tiên giữa nhóm bot trả lời thời gian thực với nhóm bot huấn luyện. Cần cảnh báo: chặn nhầm nhóm search hoặc answer là thiệt hại âm thầm, vì lưu lượng SEO cũ vẫn còn một thời gian nên quản trị viên khó nhận ra ngay rằng website đã biến mất khỏi câu trả lời AI hoặc đang rớt dần khỏi chỉ mục.
Chặn bot mang lại lợi ích gì?
Chặn đúng bot rác mang lại lợi ích trên nhiều mặt cùng lúc mà không đánh đổi bằng thứ hạng hay hiện diện AI. Các lợi ích chính gồm:
- Tiết kiệm tài nguyên và băng thông: bot rác có thể chiếm hàng chục phần trăm request; riêng Bytespider từng chiếm khoảng 13% lưu lượng theo dữ liệu TOS quan sát trên hệ thống (8/2026).
- Tăng tốc và ổn định: bớt tải bot rác giúp máy chủ phục vụ người dùng thật và bot tốt nhanh hơn, ít nghẽn hơn.
- Bảo mật: chặn scanner, exploit và brute-force giúp giảm bề mặt tấn công và nguy cơ bị xâm nhập.
- Bảo vệ nội dung: hạn chế scraper sao chép bài viết, hình ảnh và dữ liệu.
- Dữ liệu sạch hơn: analytics và log bớt nhiễu bot nên đo lường chính xác hơn.
- Tiết kiệm chi phí: ít băng thông và CPU đồng nghĩa chi phí hạ tầng thấp hơn, đặc biệt với site tải lớn.
- Không ảnh hưởng SEO/GEO: vì chỉ chặn bot rác và giữ toàn bộ bot search cùng bot AI trả lời.
Cách chặn bot đúng cách
Chặn bot đúng cách là kết hợp nhiều tầng, chọn công cụ phù hợp với việc bot có tuân thủ robots.txt hay không, và luôn xác minh trước khi chặn. Bot tuân thủ, như một số crawler SEO, chỉ cần khai báo User-agent kèm Disallow trong robots.txt. Bot cố tình bỏ qua hoặc giả mạo, như Bytespider, scraper và scanner, chỉ chặn được ở tầng máy chủ hoặc WAF theo User-Agent hoặc dải IP đã xác minh. Với bot spam, cách hiệu quả là đóng bình luận và pingback rồi chặn wp-comments-post.php cùng xmlrpc.php ở nginx.
- Phân loại theo mức tuân thủ: bot tuân thủ dùng robots.txt; bot bỏ qua hoặc giả mạo dùng nginx, Apache hoặc WAF.
- Chặn theo User-Agent: ở tầng máy chủ, so khớp chuỗi UA của nhóm bad-bot và trả về mã 403.
- Xác minh bot thật trước khi chặn: đối chiếu dải IP nhà cung cấp công bố kết hợp reverse DNS để tránh chặn nhầm Googlebot hay bot AI thật bị giả UA.
- Xử lý spam đúng chỗ: đóng comment và pingback, chặn wp-comments-post.php và xmlrpc.php.
- Rà log định kỳ: bot mới xuất hiện liên tục, nên soát log hàng tuần hoặc hàng tháng và chỉ chặn có chủ đích nhóm tải cao, ít giá trị.
- Mở mặc định cho nhóm search và answer: luôn để Google, Bing và toàn bộ bot AI trả lời được crawl bình thường.
Cách làm này đã được áp dụng thực tế trên hệ thống TOS: chặn Bytespider cùng nhóm bad-bot như MJ12bot, DotBot và PetalBot ở nginx bằng cách trả về 403, trong khi vẫn giữ nguyên Google, Bing, toàn bộ bot AI phục vụ GEO và cả Ahrefs, Semrush đang được sử dụng. Nhờ đó, tài nguyên được giải phóng mà thứ hạng và độ hiển thị AI không hề suy giảm.
TOS đồng hành cùng bạn
TOS hỗ trợ doanh nghiệp thiết lập chính sách chặn bot an toàn, vừa loại bỏ lưu lượng rác vừa bảo toàn khả năng hiện diện trên tìm kiếm và AI. Đội ngũ TOS giúp rà soát log máy chủ, phân loại bot theo giá trị thực, cấu hình chặn ở tầng nginx hoặc WAF và giám sát định kỳ để bot mới không lọt lưới. Doanh nghiệp muốn biết mình đang hiện diện ra sao trên các câu trả lời AI có thể bắt đầu bằng công cụ kiểm tra hiện diện AI miễn phí, rồi cùng TOS xây dựng lộ trình quản lý bot và tối ưu GEO an toàn.
Kết luận
Bot nên chặn là những crawler chỉ tiêu tốn tài nguyên, đe dọa bảo mật hoặc sao chép nội dung mà không đóng góp gì cho SEO và GEO của website. Bảy nhóm cần ưu tiên xử lý gồm scraper AI hung hãn như Bytespider, bot dò lỗ hổng và tấn công, bot giả mạo hoặc bỏ trống User-Agent, scraper cào và bán lại dữ liệu, crawler SEO của công cụ không dùng, bot spam và nhóm bot thu thập ảnh mang tính tùy chọn. Chặn đúng những nhóm này giúp tiết kiệm băng thông và chi phí, tăng tốc và ổn định website, siết chặt bảo mật, bảo vệ nội dung và làm sạch dữ liệu đo lường. Điều quan trọng nhất là chặn phải có chọn lọc: giữ nguyên Googlebot, Bingbot và toàn bộ bot AI trả lời như ChatGPT-User, PerplexityBot hay ClaudeBot, đồng thời giữ Ahrefs và Semrush nếu doanh nghiệp đang dùng. Dữ liệu TOS quan sát trên hệ thống (8/2026) cho thấy chặn Bytespider giúp giảm mạnh lưu lượng rác mà không tác động tới thứ hạng hay hiện diện AI. Chặn đúng bot rác không phải là đánh đổi với SEO, mà là điều kiện để website vận hành gọn gàng, an toàn và hiệu quả hơn.
Câu hỏi thường gặp
Có nên chặn tất cả bot không?
Không nên chặn tất cả bot, mà chỉ chặn nhóm bot rác không tạo giá trị. Nếu chặn toàn bộ, website sẽ mất luôn Googlebot và Bingbot phục vụ lập chỉ mục, cùng các bot AI đưa thương hiệu vào câu trả lời của ChatGPT, Perplexity hay Claude. Cách đúng là phân loại bot theo giá trị: giữ nhóm công cụ tìm kiếm và bot AI trả lời, chỉ chặn scraper hung hãn, bot dò lỗ hổng, bot giả mạo và bot spam. Chặn có chọn lọc giúp tiết kiệm tài nguyên mà không đánh đổi thứ hạng hay hiện diện AI.
Chặn Bytespider có mất SEO không?
Chặn Bytespider thường không làm mất SEO, vì đây là bot của ByteDance chứ không phải bot công cụ tìm kiếm mà website dựa vào để index. Google vẫn lập chỉ mục và xếp hạng bình thường qua Googlebot. Theo dữ liệu TOS quan sát trên hệ thống (8/2026), Bytespider từng chiếm khoảng 13% lưu lượng mà gần như không mang lại lượt truy cập; sau khi chặn, tài nguyên được giải phóng trong khi thứ hạng không đổi. Điều cần thận trọng là phân biệt Bytespider với bot search và bot AI hữu ích để tránh chặn nhầm.
Chặn bot AI có hại GEO không?
Chặn nhầm bot AI trả lời sẽ gây hại cho GEO, nên nhóm này phải được giữ nguyên. Các bot như ChatGPT-User, OAI-SearchBot, PerplexityBot, ClaudeBot, Applebot hay meta-externalagent chính là kênh đưa nội dung website vào câu trả lời AI; chặn chúng đồng nghĩa thương hiệu biến mất khỏi những câu trả lời đó. Riêng nhóm bot huấn luyện như GPTBot, CCBot và Google-Extended, mặc định vẫn nên giữ và chỉ opt-out khi có lý do bản quyền cụ thể, vì chặn training không làm mất trích dẫn đang có.
Làm sao chặn bot không tuân thủ robots.txt?
Bot bỏ qua robots.txt chỉ có thể chặn ở tầng máy chủ hoặc tường lửa ứng dụng web (WAF), không thể chặn bằng robots.txt. Cách phổ biến là so khớp chuỗi User-Agent của nhóm bad-bot trong cấu hình nginx hoặc Apache rồi trả về mã 403, hoặc chặn theo dải IP đã xác minh. Với bot giả mạo danh tính, cần kết hợp thêm xác minh IP và reverse DNS để tránh chặn nhầm bot thật. Đây là cách xử lý hiệu quả với Bytespider, scraper và scanner vốn không tôn trọng khai báo tự nguyện.
Chặn bot có tăng tốc website không?
Chặn bot rác giúp website nhanh và ổn định hơn nhờ giảm tải request vô ích. Khi bot rác chiếm hàng chục phần trăm request, máy chủ phải xử lý khối lượng lớn truy cập không mang giá trị, dễ gây nghẽn vào giờ cao điểm. Loại bỏ nhóm này giúp CPU và băng thông dồn cho người dùng thật cùng bot tốt, giảm thời gian phản hồi và hạ chi phí hạ tầng. Theo dữ liệu TOS quan sát trên hệ thống (8/2026), việc chặn Bytespider đã giải phóng đáng kể tài nguyên mà không tác động tới thứ hạng.
Có nên chặn Ahrefs hoặc Semrush không?
Chỉ nên chặn AhrefsBot hoặc SemrushBot nếu doanh nghiệp không dùng hai công cụ này. Nếu đang dùng Ahrefs hoặc Semrush để audit SEO, cần giữ crawler của chúng vì các tính năng phân tích phụ thuộc vào việc bot được phép crawl website. Ngược lại, nếu không dùng, đây chỉ là crawler ngốn crawl budget và tài nguyên nên có thể chặn để log gọn hơn. Nguyên tắc chung cho mọi crawler SEO: chỉ chặn công cụ mình không sử dụng, không chặn theo phản xạ toàn bộ.
Nhận bài SEO & AI mới mỗi ngày
Chắt lọc, thực chiến, không spam. Nhận bài mới cùng hàng nghìn marketer đọc TOS mỗi ngày.