Le chunking consiste à découper les documents en passages de taille réduite, les chunks, avant de les transformer en embeddings et de les stocker dans une base vectorielle. La taille des passages et leur chevauchement influencent fortement la pertinence d'un RAG : trop courts, ils perdent le contexte, trop longs, ils diluent l'information.
En pratique chez Gensai
Chez Gensai, le découpage est ajusté à chaque type de document, textes juridiques, fiches techniques ou transcriptions, pour que le chatbot retrouve le bon passage.