Équipe Agora
Agora — synthétiser la parole citoyenne
Une place d'expression ouverte qui agrège les consultations citoyennes de l'Assemblée et en fait ressortir, de manière transparente, les tendances, les points de convergence et les idées les plus représentées.
**Contexte.** Lorsque des commissions réalisent des consultations citoyennes, elles posent parfois des questions ouvertes pouvant recueillir jusqu'à **10 000 réponses**. Leur analyse manuelle est coûteuse et lente, et nécessite une méthodologie pour faire ressortir les points communs de ces retours. **Enjeu.** Comment extraire les tendances, les points de convergence et les idées les plus pertinentes d'un grand volume de réponses en langage naturel, de manière **transparente** et **reproductible** ? **Objectifs.** - Inclure le citoyen au centre du débat politique en lui offrant un moyen d'expression. - Équiper les membres de l'Assemblée d'une visualisation fiable et intuitive des positions les plus représentées et des axes de consensus. - Faciliter l'ingestion des données agrégées lors des consultations citoyennes — réduction des coûts et du temps. **Déroulé / approche.** 1. **Prétraitement** : nettoyage (fautes, doublons), détection de langue, anonymisation. 2. **Analyse** : clustering sémantique (embeddings + K-means / HDBSCAN) pour regrouper les réponses par idées communes ; extraction de mots-clés (TF-IDF, LDA) pour les sujets dominants ; analyse de sentiment pour l'opinion globale. 3. **Visualisation** : cartes de chaleur, nuages de mots interactifs, graphes de co-occurrence. 4. **Validation humaine** : interface pour explorer les réponses individuelles et auditer chaque cluster. **Données.** L'Assemblée ne publie pas les réponses brutes des consultations (données personnelles). Le système est donc entraîné et évalué sur des jeux **équivalents ou publiés** : - *Consultation TikTok* (open data Assemblée) — cas réel publié avec une question ouverte (33 609 réponses). - *x-stance* (ZurichNLP) — 150 questions politiques et ~67 000 commentaires de candidats, labellisés FAVOR/AGAINST, pour entraîner et évaluer le clustering.