ToolboxAgent

文本提取URL

在線從文本中提取所有URL鏈接,支持去重和數量統計,適合數據清洗和鏈接收集。

使用說明

  1. 1 在輸入框中粘貼包含URL的文本
  2. 2 選擇是否去重,查看提取結果
  3. 3 一鍵複製所有提取到的URL

相關工具

關於此工具

URL 提取工具通過正則表達式從任意文本中識別並提取出所有 http/https 鏈接,支持一鍵去重,並顯示提取到的鏈接總數,每條 URL 獨佔一行,方便後續處理。

典型使用場景:從爬蟲抓取的 HTML 中提取所有外鏈、從運營報表或聊天記錄中收集所有分享鏈接、從 API 返回的 JSON 數據中批量抽取圖片 URL、整理參考文獻中的鏈接、檢查文章中是否包含特定域名的鏈接。

相比手動逐一找鏈接或寫正則腳本,這個工具一粘貼即完成提取,無需編程,適合運營、編輯、數據分析師在日常工作中快速收集鏈接列表,處理結果可直接導入爬蟲工具或電子表格。

常見問題

能提取哪些格式的 URL? +

工具主要識別以 http:// 或 https:// 開頭的標準 URL,包括帶路徑、查詢參數和錨點的完整鏈接。不帶協議前綴的相對鏈接(如 /path/to/page)或僅有域名的鏈接(如 example.com)默認不提取,因為這類格式在普通文本中容易產生誤判。

提取出來的 URL 後面跟著標點符號怎麼辦? +

URL 後如果跟著句號、逗號、括號等標點,工具會嘗試智能判斷這些標點是否屬於 URL 的一部分。通常句號、逗號不屬於 URL,會被自動去掉。但如果 URL 本身包含括號(某些 Wikipedia 鏈接),可能需要手動檢查並修正提取結果。

「去重」選項是怎麼工作的? +

開啟去重選項後,完全相同的 URL(包括協議、域名、路徑、查詢參數都一致)只保留一條。URL 比較是大小寫敏感的,http://Example.com 和 http://example.com 會被視為不同 URL。如果需要域名級別的去重,需要將結果導出後再用其他工具處理。

能提取圖片鏈接(.jpg、.png)或文件鏈接(.pdf)嗎? +

可以。工具提取所有符合 http/https 格式的 URL,不區分鏈接指向的是網頁、圖片、PDF 還是其他文件類型。如果只想保留特定類型的鏈接(如所有 .jpg 圖片鏈接),可以提取全部 URL 後,再用文本搜索或過濾工具篩選出包含 .jpg 的行。

文本很長時提取速度快嗎? +

工具在瀏覽器本地運行,使用正則表達式掃描,處理速度取決於文本長度。通常 10 萬字以內的文本提取速度非常快,不超過 1 秒。如果處理超大文本(數百萬字符),可能有輕微延遲,但不會卡死瀏覽器,所有數據在本地處理,不上傳服務器。