Web Scraping e extração de dados em estruturas HTML com visualização em interface web: um estudo de caso
| dc.contributor.advisor | Rodrigues, Walace de Almeida | |
| dc.contributor.author | Maciente, Renato Zampiere | |
| dc.date.accessioned | 2026-07-08T12:16:10Z | |
| dc.date.created | 2025-07-23 | |
| dc.date.issued | 2025-07-23 | |
| dc.description | O mercado de itens virtuais em jogos eletrônicos tem se expandido significativamente, em títulos como Counter-Strike, onde skins podem alcançar alto valor comercial. Diante da oscilação constante de preços entre plataformas, o acesso a dados atualizados é fundamental para subsidiar decisões de compra. Este trabalho apresenta um estudo de caso e a implementação de um sistema automatizado para coleta e centralização, em tempo real, de informações sobre skins de Counter-Strike, a partir de cinco plataformas especializadas. A extração foi realizada com a biblioteca Selenium, em conjunto com WebDriver e undetected_chromedriver, visando contornar sistemas anti-bot. As informações coletadas, nome do item, preço, tipo de acabamento, nível de desgaste (float) e imagem, foram extraídas com base em seletores específicos de tags HTML, como <div>, <span> e <img>, e tratadas com a biblioteca pandas para padronização e posterior análise. A visualização dos dados foi realizada por meio de uma interface interativa desenvolvida com Dash Bootstrap, facilitando a navegação e análise por parte do usuário. A aplicação também foi otimizada com o uso de threads, permitindo maior agilidade no processo de coleta, especialmente em ambientes com múltiplas fontes. Adicionalmente, foi implementado um modo de raspagem dinâmica, voltado a usuários com conhecimentos prévios em estruturas HTML. Esse modo permite a personalização do processo de coleta, possibilitando que o usuário defina manualmente os seletores HTML, o tipo de rolagem da página (paginada, infinita ou alternada), e a URL de destino. Tal funcionalidade expande a aplicabilidade da ferramenta, permitindo que novos sites sejam integrados ao sistema conforme os mesmos princípios técnicos adotados no estudo principal. Entre os principais desafios, destacam-se o carregamento assíncrono via JavaScript e mecanismos de proteção contra automação, superados com renderização forçada e uso de navegação não detectável. A proposta visa facilitar o acesso e a análise dos dados pelo usuário, promovendo maior eficiência na interpretação dos valores e características dos itens ofertados. | |
| dc.description.abstract | The virtual item market in electronic games has grown significantly, particularly in titles such as Counter-Strike, where skins can reach high commercial value. Given the constant price fluctuations across platforms, access to real-time data is essential to support purchasing decisions. This study presents a case study and the implementation of an automated system for the real-time collection and centralization of Counter-Strike skin data from five specialized platforms. Data extraction was conducted using the Selenium library, combined with WebDriver and undetected_chromedriver, to bypass anti-bot mechanisms. Information such as item name, price, finish type, wear level (float), and image was extracted based on specific HTML tag selectors such as <div>, <span>, and <img>, and subsequently processed using the pandas library for standardization and analysis. Data visualization was enabled through an interactive interface developed with Dash Bootstrap, allowing for user-friendly navigation and analysis. The application was further optimized using multithreading to enhance scraping efficiency, particularly in environments with multiple sources. Additionally, a dynamic scraping mode was implemented for users with prior knowledge of HTML structure, allowing manual customization of HTML selectors, page scroll type (paginated, infinite, or alternating), and target URL. This feature broadens the tool’s applicability by enabling integration with new websites following the same technical principles used in the main study. Among the key challenges addressed were asynchronous JavaScript content loading and automation detection mechanisms, which were overcome through forced rendering and stealth navigation techniques. The proposed solution aims to facilitate user access and analysis of data, promoting greater efficiency in interpreting item values and characteristics. | |
| dc.identifier.advisorLattes | 3794866322826802 | |
| dc.identifier.advisorOrcid | 0000-0001-9950-0563 | |
| dc.identifier.authorOrcid | 111111111111111111111111111111111111 | |
| dc.identifier.uri | https://hdl.handle.net/20.500.14387/3245 | |
| dc.language.iso | Português | |
| dc.publisher.campi | Formiga | |
| dc.publisher.country | Brasil | |
| dc.publisher.institution | Instituto Federal de Minas Gerais | |
| dc.rights | Acesso aberto | |
| dc.subject.cnpq | Ciências Exatas e da Terra | |
| dc.subject.keyword | Counter-Strike, Páginas WEB, Skins Virtuais, Web Scraping. | |
| dc.subject.keywords | Counter-Strike. | |
| dc.subject.keywords | Skins | |
| dc.subject.keywords | Páginas WEB. | |
| dc.subject.keywords | Skins virtuais. | |
| dc.subject.keywords | WEB Scraping. | |
| dc.subject.keywords | Webdriver. | |
| dc.title | Web Scraping e extração de dados em estruturas HTML com visualização em interface web: um estudo de caso | |
| dc.title.alternative | Web scraping and data extraction from HTML structures with visualization in a web interface: a case study | |
| dc.type | Trabalho de Conclusão de Curso |
