Web Scraping e extração de dados em estruturas HTML com visualização em interface web: um estudo de caso

dc.contributor.advisorRodrigues, Walace de Almeida
dc.contributor.authorMaciente, Renato Zampiere
dc.date.accessioned2026-07-08T12:16:10Z
dc.date.created2025-07-23
dc.date.issued2025-07-23
dc.descriptionO mercado de itens virtuais em jogos eletrônicos tem se expandido significativamente, em títulos como Counter-Strike, onde skins podem alcançar alto valor comercial. Diante da oscilação constante de preços entre plataformas, o acesso a dados atualizados é fundamental para subsidiar decisões de compra. Este trabalho apresenta um estudo de caso e a implementação de um sistema automatizado para coleta e centralização, em tempo real, de informações sobre skins de Counter-Strike, a partir de cinco plataformas especializadas. A extração foi realizada com a biblioteca Selenium, em conjunto com WebDriver e undetected_chromedriver, visando contornar sistemas anti-bot. As informações coletadas, nome do item, preço, tipo de acabamento, nível de desgaste (float) e imagem, foram extraídas com base em seletores específicos de tags HTML, como <div>, <span> e <img>, e tratadas com a biblioteca pandas para padronização e posterior análise. A visualização dos dados foi realizada por meio de uma interface interativa desenvolvida com Dash Bootstrap, facilitando a navegação e análise por parte do usuário. A aplicação também foi otimizada com o uso de threads, permitindo maior agilidade no processo de coleta, especialmente em ambientes com múltiplas fontes. Adicionalmente, foi implementado um modo de raspagem dinâmica, voltado a usuários com conhecimentos prévios em estruturas HTML. Esse modo permite a personalização do processo de coleta, possibilitando que o usuário defina manualmente os seletores HTML, o tipo de rolagem da página (paginada, infinita ou alternada), e a URL de destino. Tal funcionalidade expande a aplicabilidade da ferramenta, permitindo que novos sites sejam integrados ao sistema conforme os mesmos princípios técnicos adotados no estudo principal. Entre os principais desafios, destacam-se o carregamento assíncrono via JavaScript e mecanismos de proteção contra automação, superados com renderização forçada e uso de navegação não detectável. A proposta visa facilitar o acesso e a análise dos dados pelo usuário, promovendo maior eficiência na interpretação dos valores e características dos itens ofertados.
dc.description.abstractThe virtual item market in electronic games has grown significantly, particularly in titles such as Counter-Strike, where skins can reach high commercial value. Given the constant price fluctuations across platforms, access to real-time data is essential to support purchasing decisions. This study presents a case study and the implementation of an automated system for the real-time collection and centralization of Counter-Strike skin data from five specialized platforms. Data extraction was conducted using the Selenium library, combined with WebDriver and undetected_chromedriver, to bypass anti-bot mechanisms. Information such as item name, price, finish type, wear level (float), and image was extracted based on specific HTML tag selectors such as <div>, <span>, and <img>, and subsequently processed using the pandas library for standardization and analysis. Data visualization was enabled through an interactive interface developed with Dash Bootstrap, allowing for user-friendly navigation and analysis. The application was further optimized using multithreading to enhance scraping efficiency, particularly in environments with multiple sources. Additionally, a dynamic scraping mode was implemented for users with prior knowledge of HTML structure, allowing manual customization of HTML selectors, page scroll type (paginated, infinite, or alternating), and target URL. This feature broadens the tool’s applicability by enabling integration with new websites following the same technical principles used in the main study. Among the key challenges addressed were asynchronous JavaScript content loading and automation detection mechanisms, which were overcome through forced rendering and stealth navigation techniques. The proposed solution aims to facilitate user access and analysis of data, promoting greater efficiency in interpreting item values and characteristics.
dc.identifier.advisorLattes3794866322826802
dc.identifier.advisorOrcid0000-0001-9950-0563
dc.identifier.authorOrcid111111111111111111111111111111111111
dc.identifier.urihttps://hdl.handle.net/20.500.14387/3245
dc.language.isoPortuguês
dc.publisher.campiFormiga
dc.publisher.countryBrasil
dc.publisher.institutionInstituto Federal de Minas Gerais
dc.rightsAcesso aberto
dc.subject.cnpqCiências Exatas e da Terra
dc.subject.keywordCounter-Strike, Páginas WEB, Skins Virtuais, Web Scraping.
dc.subject.keywordsCounter-Strike.
dc.subject.keywordsSkins
dc.subject.keywordsPáginas WEB.
dc.subject.keywordsSkins virtuais.
dc.subject.keywordsWEB Scraping.
dc.subject.keywordsWebdriver.
dc.titleWeb Scraping e extração de dados em estruturas HTML com visualização em interface web: um estudo de caso
dc.title.alternativeWeb scraping and data extraction from HTML structures with visualization in a web interface: a case study
dc.typeTrabalho de Conclusão de Curso

Arquivos

Pacote original

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
Renato_Zampiere_Maciente.pdf
Tamanho:
11.46 MB
Formato:
Adobe Portable Document Format

Licença do pacote

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
license.txt
Tamanho:
1.79 KB
Formato:
Item-specific license agreed to upon submission
Descrição: