Légitus — assistant IA pour la législation et le droit français

Légitus — assistant IA pour la législation et le droit français

Porteur : Fine tuning de modèle
0 personne inscrite
Accessibilité de la loi Application des lois Lois Projets et propositions de loi
Galerie des fêtes de l'Hôtel de Lassay

Numéro de table à l'Hôtel de Lassay

Aucune table renseignée

Ce contenu est contributif, il n'est pas rédigé par l'Assemblée nationale.

Le contenu de cette page est écrit par les contributeurs du projet depuis le dépôt de code.

À propos du défi

Un assistant conversationnel spécialisé en droit français, entraîné pour répondre en s'appuyant uniquement sur des sources légales fournies, citer précisément les articles utilisés, et explicitement dire quand il ne sait pas plutôt que d'inventer une réponse.

Contexte et objectif. Les modèles de langage généralistes répondent souvent avec assurance à
des questions de droit sans réellement s'appuyer sur un texte légal précis, ce qui est
particulièrement risqué en matière juridique. L'objectif de Légitus est de construire un assistant
qui cite ses sources, refuse de répondre quand les sources fournies sont insuffisantes,
hors sujet, ou ne couvrent pas la date visée, et qui reste concis et **capable d'appeler un
outil de recherche juridique** quand c'est pertinent — plutôt qu'un assistant juridique généraliste
qui « sonne juste » sans être vérifiable.

Déroulé. Le pipeline part de swiss-ai/Apertus-8B-2509 et suit 4 étapes, détaillées dans
docs/pipeline.md :

  1. Pré-entraînement continué (CPT) sur le corpus LEGI (codes, lois et règlements consolidés

via Légifrance), pour ancrer une connaissance de fond du droit français dans le modèle.

  1. Construction d'un jeu de données d'instruction combinant : ~27 000 exemples juridiques

synthétiques (RAG ancré, abstention, appel d'outil, extraction, citation structurée),
200 exemples d'identité/politesse conçus pour renforcer un arrêt de génération propre, et une
sélection filtrée d'instructions générales issues de jeux de données publics — pour garder une
bonne fluidité conversationnelle sans diluer la spécialisation juridique.

  1. Instruction-tuning (SFT) avec perte calculée uniquement sur les tours de l'assistant, en

gelant les embeddings/la tête de sortie hérités du CPT.

  1. Fusion de poids avec le modèle Apertus-8B-Instruct-2509 original, pour transférer une

partie de sa robustesse générale (arrêt propre de génération, conversation naturelle) tout en
conservant l'essentiel du comportement juridique appris.

Résultats. Le modèle final répond en citant explicitement ses sources ([S1], identifiant
Légifrance), détecte les cas où l'article fourni est abrogé ou hors-sujet, et refuse de répondre
quand les sources ne suffisent pas — voir la galerie de captures ci-dessous pour des exemples
concrets, y compris une comparaison où le modèle fusionné évite une erreur de lecture de date que
le modèle original avait commise.

Limites connues, documentées en toute transparence dans la
fiche du modèle et la
fiche du dataset : l'entraînement SFT
était encore en cours au moment de la fusion présentée ici, et l'auto-identification du modèle
(« qui es-tu ? ») s'est révélée moins fiable après la fusion — un compromis assumé et documenté
plutôt que caché.

Galerie d'images

Comparaison 1 — Apertus original vs Légitus fusionné, question de culture juridique générale
Comparaison 2 — RAG ancré avec citation (création d'un syndicat de communes)
Comparaison 3 — question fermée sans système (séparation des pouvoirs)

Documents du défi

Informations du défi

Livrables du défi

Ressources utilisées

Participants

Porteur du défi

Fine tuning de modèle

Contributeurs

Moncif El-Mouden