Questão nº 87
Questão de Engenharia de Dados · FCC PMSP Analista TIC 2025 (nº 87)
Suponha que a Prefeitura de São Paulo deseje implementar um sistema de análise de dados para prever demandas de transporte público e identificar padrões de deslocamento em diferentes horários e regiões. Os dados disponíveis incluem registros históricos de viagens, horários de pico, informações demográficas e localizações geográficas. Para prever o aumento na demanda em horários específicos e identificar agrupamentos de regiões com padrões semelhantes de uso, deve-se
- Autilizar um modelo de Regressão Logística para prever as demandas de transporte público e Redes Neurais Convolucionais (CNN) para identificar padrões de deslocamento em horários de pico.
- Baplicar Regressão Linear para prever a demanda futura com base em variáveis como horário e histórico de viagens e utilizar o algoritmo não supervisionado K-Means para identificar agrupamentos de regiões com padrões similares de uso. (alternativa correta)
- Ctreinar um modelo não supervisionado de Support Vector Machine (SVM) para prever a demanda em horários específicos e Redes Neurais Recorrentes (RNN) para identificar padrões de deslocamento ao longo do tempo.
- Dusar Árvores de Decisão para prever demandas futuras e treinar um modelo supervisionado de clusterização hierárquica para identificar padrões de deslocamento em horários específicos, através de dendogramas.
- Eaplicar Regressão Logística para prever a demanda futura com base em histórico de viagens e utilizar o método ARIMA (Autoregressive Integrated Moving Average) para identificar agrupamentos de regiões para segmentação de dados geográficos.
Resposta comentada
Gabarito Alternativa B
Prever demanda é um problema de regressão (supervisionado), pois buscamos um valor numérico contínuo; identificar agrupamentos é um problema de clusterização (não supervisionado), pois buscamos grupos sem rótulos pré-definidos.
(A) Incorreta: Regressão Logística é para classificação (prever categorias), não para prever demanda numérica. CNNs são mais usadas para dados espaciais como imagens e não são a escolha mais direta para agrupar regiões por padrões de uso.
(B) Correta: Regressão Linear é ideal para prever valores contínuos (demanda) com base em variáveis. O algoritmo K-Means é um método de clusterização não supervisionado perfeito para agrupar regiões com características semelhantes.
(C) Incorreta: SVM é primariamente um algoritmo de classificação supervisionada (embora exista SVR para regressão, não é "não supervisionado" para prever demanda). RNNs são para sequências temporais, mas o problema pede "agrupamentos de regiões", que é uma tarefa de clusterização, não de previsão sequencial para agrupamento.
(D) Incorreta: Árvores de Decisão podem ser usadas para regressão, mas a clusterização hierárquica é um método não supervisionado. Chamar um "modelo supervisionado de clusterização hierárquica" é uma contradição fundamental e a armadilha da banca, pois clusterização é, por definição, não supervisionada.
(E) Incorreta: Regressão Logística é para classificação, não para prever demanda numérica. ARIMA é um modelo para previsão de séries temporais, não para identificar agrupamentos de regiões (clusterização).
Fonte: FCC PMSP Analista TIC 2025 Analista de Planejamento e Desenvolvimento Organizacional - Tecnologia da Informação e Comunicação (Caderno Tipo 001). Reproduzida para fins de estudo.