Légitus — assistant IA pour la législation et le droit français

Numéro de table à l'Hôtel de Lassay
Aucune table renseignée
Ce contenu est contributif, il n'est pas rédigé par l'Assemblée nationale.
Le contenu de cette page est écrit par les contributeurs du projet depuis le dépôt de code.
À propos du défi
Un assistant conversationnel spécialisé en droit français, entraîné pour répondre en s'appuyant uniquement sur des sources légales fournies, citer précisément les articles utilisés, et explicitement dire quand il ne sait pas plutôt que d'inventer une réponse.
Contexte et objectif. Les modèles de langage généralistes répondent souvent avec assurance à
des questions de droit sans réellement s'appuyer sur un texte légal précis, ce qui est
particulièrement risqué en matière juridique. L'objectif de Légitus est de construire un assistant
qui cite ses sources, refuse de répondre quand les sources fournies sont insuffisantes,
hors sujet, ou ne couvrent pas la date visée, et qui reste concis et **capable d'appeler un
outil de recherche juridique** quand c'est pertinent — plutôt qu'un assistant juridique généraliste
qui « sonne juste » sans être vérifiable.
Déroulé. Le pipeline part de swiss-ai/Apertus-8B-2509 et suit 4 étapes, détaillées dansdocs/pipeline.md :
- Pré-entraînement continué (CPT) sur le corpus LEGI (codes, lois et règlements consolidés
via Légifrance), pour ancrer une connaissance de fond du droit français dans le modèle.
- Construction d'un jeu de données d'instruction combinant : ~27 000 exemples juridiques
synthétiques (RAG ancré, abstention, appel d'outil, extraction, citation structurée),
200 exemples d'identité/politesse conçus pour renforcer un arrêt de génération propre, et une
sélection filtrée d'instructions générales issues de jeux de données publics — pour garder une
bonne fluidité conversationnelle sans diluer la spécialisation juridique.
- Instruction-tuning (SFT) avec perte calculée uniquement sur les tours de l'assistant, en
gelant les embeddings/la tête de sortie hérités du CPT.
- Fusion de poids avec le modèle
Apertus-8B-Instruct-2509original, pour transférer une
partie de sa robustesse générale (arrêt propre de génération, conversation naturelle) tout en
conservant l'essentiel du comportement juridique appris.
Résultats. Le modèle final répond en citant explicitement ses sources ([S1], identifiant
Légifrance), détecte les cas où l'article fourni est abrogé ou hors-sujet, et refuse de répondre
quand les sources ne suffisent pas — voir la galerie de captures ci-dessous pour des exemples
concrets, y compris une comparaison où le modèle fusionné évite une erreur de lecture de date que
le modèle original avait commise.
Limites connues, documentées en toute transparence dans la
fiche du modèle et la
fiche du dataset : l'entraînement SFT
était encore en cours au moment de la fusion présentée ici, et l'auto-identification du modèle
(« qui es-tu ? ») s'est révélée moins fiable après la fusion — un compromis assumé et documenté
plutôt que caché.