-
Notifications
You must be signed in to change notification settings - Fork 0
Expand file tree
/
Copy pathmain.py
More file actions
92 lines (75 loc) · 3.12 KB
/
Copy pathmain.py
File metadata and controls
92 lines (75 loc) · 3.12 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
from webdriver_manager.chrome import ChromeDriverManager
from openpyxl import load_workbook
from openpyxl.utils import get_column_letter
def scrape_data(url, driver):
driver.get(url)
WebDriverWait(driver, 10).until(EC.presence_of_element_located((By.TAG_NAME, "body")))
scraped_data = {}
scraped_data['text'] = driver.find_elements(By.XPATH, "//p | //span | //div")
scraped_data['images'] = driver.find_elements(By.TAG_NAME, "img")
scraped_data['links'] = driver.find_elements(By.TAG_NAME, "a")
text_content = ""
for element in scraped_data['text']:
text_content += element.text + "\n"
scraped_data['text'] = text_content.strip()
image_urls = []
for image in scraped_data['images']:
image_url = image.get_attribute("src")
if image_url:
image_urls.append(image_url)
scraped_data['images'] = image_urls
link_urls = []
for link in scraped_data['links']:
link_url = link.get_attribute("href")
if link_url:
link_urls.append(link_url)
scraped_data['links'] = link_urls
return scraped_data
def main():
options = webdriver.ChromeOptions()
options.add_argument("--headless")
driver = webdriver.Chrome()
website_links = []
try:
workbook = load_workbook("C:\\Users\\ACER\\Desktop\\Web Scraper selenium\\LinksSeleniumWEBSC.xlsx")
worksheet = workbook["Sheet1"]
for row in worksheet.iter_rows(min_row=2):
cell_value = row[0].value
if cell_value:
website_links.append(cell_value)
except FileNotFoundError:
print("Error: Excel file not found!")
return
except Exception as e:
print("Error reading Excel file:", e)
return
scraped_data = []
for link in website_links:
try:
data = scrape_data(link, driver)
scraped_data.append(data)
except Exception as e:
print(f"Error scraping {link}:", e)
driver.quit()
try:
workbook = load_workbook("C:\\Users\\ACER\\Desktop\\Web Scraper selenium\\link2.xlsx")
worksheet = workbook.create_sheet("Scraped_Data")
headers = ['Text', 'Images', 'Links']
for col, header in enumerate(headers, start=1):
worksheet.cell(row=1, column=col, value=header)
for row, data in enumerate(scraped_data, start=2):
worksheet.cell(row=row, column=1, value=data['text'])
worksheet.cell(row=row, column=2, value='\n'.join(data['images']))
worksheet.cell(row=row, column=3, value='\n'.join(data['links']))
workbook.save("C:\\Users\\ACER\\Desktop\\Web Scraper selenium\\link2.xlsx")
print("Scraped data has been successfully written to the Excel file.")
except FileNotFoundError:
print("Error: Excel file not found!")
except Exception as e:
print("Error writing to Excel file:", e)
if __name__ == "__main__":
main()