Skip to main content
If you continue browsing this website, you agree to our policies:
  • Condizioni di utilizzo e trattamento dei dati
Continue
x
e-Learning - UNIMIB
  • Home
  • My Media
  • More
Listen to this page using ReadSpeaker
 Log in
e-Learning - UNIMIB
Home My Media
Percorso della pagina
  1. Science
  2. Master Degree
  3. Informatica [F1802Q - F1801Q]
  4. Courses
  5. A.A. 2026-2027
  6. 2nd year
  1. Information Retrieval
  2. Summary
Insegnamento Course full name
Information Retrieval
Course ID number
2627-2-F1802Q127
Course summary SYLLABUS

Course Syllabus

  • Italiano ‎(it)‎
  • English ‎(en)‎
Export

Obiettivi

Conoscenza e capacità di comprensione
L’obiettivo del corso è fornire conoscenze e capacità di comprensione dei principali concetti, modelli e tecniche alla base della progettazione dei sistemi di Information Retrieval, noti anche come motori di ricerca.

Il corso introduce l’Information Retrieval come l’area che si occupa dell’accesso automatico a informazioni testuali in risposta ai bisogni informativi degli utenti, espressi attraverso query.

Gli studenti acquisiranno conoscenze sulle principali fasi delle pipeline alla base del funzionamento di un sistema di Information Retrieval, tra cui il preprocessing del testo, la rappresentazione del testo, l’indicizzazione, l’elaborazione delle query, il recupero, il ranking e la valutazione.

Comprenderanno i principali modelli di recupero utilizzati per stimare la rilevanza dei documenti rispetto a una query utente, inclusi approcci basati su corrispondenza esatta, lessicali, probabilistici, neurali e ibridi.

Il corso mostrerà come l’Information Retrieval costituisca una componente fondamentale di tecnologie moderne, tra cui motori di ricerca Web, sistemi di ricerca per domini specifici, Retrieval-Augmented Generation e sistemi conversazionali basati su Large Language Models.

Le attività di laboratorio supporteranno la parte teorica del corso attraverso la progettazione, l’implementazione e la valutazione pratica di applicazioni di Information Retrieval mediante software open-source.

Durante le attività di laboratorio, gli studenti avranno l’opportunità di affrontare un problema di ricerca reale e di presentare la propria soluzione. Questa attività permetterà agli studenti di applicare le conoscenze acquisite durante il corso e di mettere alla prova la propria capacità di analizzare un problema, compiere scelte tecniche di progettazione e sviluppare una soluzione originale.

Capacità di applicare conoscenza e comprensione
Attraverso le lezioni e le attività di laboratorio, gli studenti saranno incoraggiati e valutati rispetto alla loro capacità di applicare le conoscenze acquisite ai temi trattati nel corso.

Autonomia di giudizio
Il corso mira a promuovere l’autonomia di giudizio e le capacità di analisi critica in relazione alle principali sfide dell’elaborazione del linguaggio naturale e della ricerca di informazioni, nonché ai relativi compiti principali. Tali competenze saranno ulteriormente sviluppate attraverso discussioni in aula e attività di laboratorio.

Abilità comunicative
Il corso favorisce lo sviluppo della capacità di comunicare contenuti tecnici, idee, problemi e relative soluzioni in modo chiaro e non ambiguo a diversi tipi di pubblico. Tali abilità saranno sviluppate durante il corso e valutate come parte dell’esame finale, in particolare attraverso la presentazione del progetto.

Capacità di apprendimento
Il corso è progettato per fornire sia conoscenze teoriche sia competenze pratiche, offrendo una solida base di partenza per ulteriori studi individuali sui principi della rappresentazione, dell’analisi e del recupero del testo.

Contenuti sintetici

  • Il corso introduce i principali concetti dell’Information Retrieval e il ruolo dei sistemi di ricerca nell’accesso all’informazione testuale.
  • Il corso presenta tecniche per il preprocessing del testo, la rappresentazione del testo e l’indicizzazione, incluse le rappresentazioni bag-of-words e gli indici invertiti.
  • Saranno introdotti i principali modelli di Information Retrieval per stimare la rilevanza dei documenti rispetto alle query degli utenti, dal retrieval booleano e dai modelli a spazio vettoriale, con particolare attenzione a BM25, fino ai modelli probabilistici e neurali.
  • Il corso tratterà inoltre la metodologia standard per la valutazione dei sistemi di ricerca, incluse le collezioni di test, i giudizi di rilevanza, le metriche di ranking e i test di significatività statistica.
  • Saranno presentate le tecniche alla base dei motori di ricerca Web, insieme ad approcci per l’interazione con l’utente, la personalizzazione, la ricerca in domini specifici e il learning to rank per la ricerca Web.
  • La parte finale del corso introdurrà i moderni sistemi di retrieval neurali e basati su Large Language Models, incluse le rappresentazioni neurali del testo, il dense retrieval, il retrieval neurale sparse e ibrido, il reranking, la Retrieval-Augmented Generation e la ricerca in sistemi agentici.

Programma esteso

  1. Introduzione all’Information Retrieval e ai sistemi di ricerca. Principali concetti dell’Information Retrieval, motori di ricerca, biblioteche digitali, enterprise search, moderni sistemi di ricerca basati su AI ed esempi di applicazioni dell’Information Retrieval.
  2. Preprocessing, rappresentazione e indicizzazione del testo. Tokenizzazione, normalizzazione, stemming, lemmatizzazione, stopword, n-grammi, metadati, campi dei documenti, rappresentazioni bag-of-words, indici invertiti, posting list, indici posizionali, compressione degli indici e pipeline di indicizzazione.
  3. Query, rilevanza e retrieval exact-match. Tipi di query, unità documentali, bisogni informativi, intento dell’utente, rilevanza, giudizi di rilevanza, retrieval booleano, operatori booleani, query di frase, ricerca per prossimità e query strutturate.
  4. Modelli di ranking lessicale. Frequenza dei termini, inverse document frequency, TF-IDF, modello a spazio vettoriale, similarità coseno, retrieval probabilistico, BM25, parametri di BM25, BM25 con campi e confronto tra TF-IDF e BM25.
  5. Valutazione dei sistemi di Information Retrieval. Collezioni di test, topic, query, qrels, giudizi di rilevanza e misure standard di valutazione per l’Information Retrieval.
  6. Interazione con l’utente, personalizzazione e ricerca Web. Riformulazione delle query, sessioni di ricerca, comportamento di click, log di ricerca, personalizzazione, ricerca esplorativa, crawling, indicizzazione Web, analisi dei link, PageRank, rilevamento dello spam, freshness e snippet.
  7. Ricerca in domini specifici e Learning to Rank. Ricerca scientifica, ricerca biomedica, ricerca legale, enterprise search, ricerca e-commerce, terminologia di dominio, vincoli di dominio, learning to rank, inclusi approcci pointwise, pairwise e listwise, feature di ranking, LambdaMART e apprendimento basato sui click.
  8. Rappresentazioni neurali e dense retrieval. Word embedding, embedding contestuali, sentence embedding, document embedding, rappresentazioni basate su transformer, bi-encoder e vector database.
  9. Retrieval neurale sparse, dense, ibrido e multi-stage. Learned sparse retrieval, neural lexical matching, metodi in stile SPLADE, retrieval ibrido sparse-dense, fusione degli score, generazione dei candidati, neural reranking, cross-encoder, modelli a late interaction, ranking in stile ColBERT e trade-off tra efficienza ed efficacia.
  10. Sistemi di ricerca basati su LLM, RAG e agenti. Riscrittura delle query, espansione delle query, generazione di query sintetiche, reranking basato su LLM, sintesi dei risultati, generazione delle risposte, architettura RAG, chunking, costruzione del contesto, grounding, generazione di citazioni, controllo delle allucinazioni, valutazione dei sistemi RAG, uso di strumenti, ricerca agentica, memoria, agenti Web e sfide di ricerca aperte.

Prerequisiti

È richiesta una conoscenza di base di statistica, algebra lineare e programmazione, ad esempio in Python.

Modalità didattica

Il corso sarà tenuto in lingua inglese e comprende sia lezioni sia esercitazioni di laboratorio.
Il corso prevede 40 ore di lezioni e 12 ore di esercitazioni di laboratorio.
La maggior parte delle lezioni avrà una durata di 2 ore, anche se alcune lezioni più intensive potranno durare 3 ore, in base all’argomento trattato.

Le lezioni saranno svolte attraverso una combinazione di modalità didattiche.

			* La prima parte di ciascuna lezione sarà principalmente basata sulla didattica frontale e introdurrà concetti teorici, modelli formali e metodi tecnici.
			* La seconda parte includerà attività didattiche interattive, come discussioni guidate, esempi, brevi esercizi e analisi di casi pratici, con l’obiettivo di incoraggiare la partecipazione attiva degli studenti e supportare l’applicazione dei concetti introdotti durante la lezione.

Durante le esercitazioni di laboratorio, gli studenti utilizzeranno software open-source per progettare, implementare e valutare componenti di sistemi di Information Retrieval.
Saranno organizzati seminari tenuti da esperti di riconosciuto profilo internazionale.
Alcune lezioni potranno essere svolte da remoto in formato interattivo.

Materiale didattico

  • Christopher D. Manning, Prabhakar Raghavan, and Hinrich Schütze. Introduction to Information Retrieval. Cambridge University Press, 2008.
  • Bhaskar Mitra and Nick Craswell. An Introduction to Neural Information Retrieval. Foundations and Trends in Information Retrieval, Volume 13, Issue 1, 2018.

Periodo di erogazione dell'insegnamento

Primo semestre.

Modalità di verifica del profitto e valutazione

  • Esame scritto individuale composto da esercizi, domande aperte e domande chiuse relative ai contenuti del corso.
  • La valutazione comprende inoltre un progetto di laboratorio, che potrà essere sviluppato individualmente o in gruppi di massimo tre studenti.
  • L’esame scritto è finalizzato a valutare il livello di comprensione degli aspetti teorici e tecnici di base trattati durante il corso.
  • L’obiettivo del progetto è utilizzare software open-source per sviluppare soluzioni tecnologiche a problemi di ricerca affrontati nel corso.
  • Il progetto si concentrerà su scenari applicativi reali che richiedono agli studenti di progettare, implementare e valutare componenti di sistemi di Information Retrieval introdotti durante il corso.

Orario di ricevimento

Da concordare con il docente.

Export

Aims

Knowledge and Understanding
The objective of the course is to provide knowledge and understanding of the main concepts, models, and techniques at the basis of the design of Information Retrieval systems (also known as Search Engines)..
The course introduces Information Retrieval as the area concerned with the automatic access to textual information in response to users' information needs expressed through queries.
Students will acquire knowledge of the main stages of the pipelines at the basis of the functioning of an Information Retrieval System, including text preprocessing, text representation, indexing, query processing, retrieval, ranking, and evaluation.
They will understand the main retrieval models used to estimate the relevance of documents with respect to a user query, including exact-match, lexical, probabilistic, neural, and hybrid approaches.
The course will show how Information Retrieval is grounding modern technologies, including Web search engines, domain-specific search systems, Retrieval-Augmented Generation, and LLM-based conversational systems.
The laboratory activities will support the theoretical part of the course through the practical design, implementation, and evaluation of Information Retrieval applications using open-source software.
During the laboratory activities, students will have the opportunity to address a real-world search problem and to present their own solution. This activity will allow students to apply the knowledge acquired during the course and to challenge their ability to analyze a problem, make technical design choices, and develop an original solution.

Applying Knowledge and Understanding
Throughout lectures and lab activities, students are encouraged and evaluated on their ability to apply the knowledge acquired to the topics covered in the course.
Autonomy of Judgment
The course aims to foster independent judgement and critical analysis skills in relation to the main challenges of natural language processing and search, as well as the related key tasks. Competencies will be further developed through in-class discussions and lab work.

Communication Skills
Development of the ability to communicate technical content, ideas, problems, and corresponding solutions clearly, and unambiguously to different types of audiences. These skills will be fostered during the course and evaluated as part of the final examination, specifically through the project presentation.

Learning Skills
The course is designed to provide both theoretical knowledge and practical skills, offering a solid starting point for further individual study of the principles of text representation, analysis, and retrieval.

Contents

  • The course introduces the main concepts of Information Retrieval and the role of search systems in accessing textual information.
  • The course presents techniques for text preprocessing, text representation, and indexing, including bag-of-words representations and inverted indexes.
  • The main IR models for estimating the relevance of documents with respect to users' queries will be introduced, from Boolean retrieval and vector space models ( with a particular focus on BM25) to probabilistic models and neural models.
  • The course will also cover the standard methodology for evaluating search systems, including test collections, relevance judgments, ranking metrics, and statistical significance testing.
  • The techniques at the basis of Web search engines will be presented, together with approaches for user interaction, personalization, domain-specific search, and learning to rank for web search.
  • The final part of the course will introduce modern neural and LLM-based retrieval systems, including neural text representations, dense retrieval, sparse and hybrid neural retrieval, reranking, Retrieval-Augmented Generation, and search in agentic systems.

Detailed program

  1. Introduction to Information Retrieval and search systems. Main concepts of Information Retrieval, search engines, digital libraries, enterprise search, modern AI-based search systems, and examples of IR applications.
  2. Text preprocessing, representation, and indexing. Tokenization, normalization, stemming, lemmatization, stopwords, n-grams, metadata, document fields, bag-of-words representations, inverted indexes, posting lists, positional indexes, index compression, and indexing pipelines.
  3. Queries, relevance, and exact-match retrieval. Query types, document units, information needs, user intent, relevance, relevance judgments, Boolean retrieval, Boolean operators, phrase queries, proximity search, and structured queries.
  4. Lexical ranking models. Term frequency, inverse document frequency, TF-IDF, vector space model, cosine similarity, probabilistic retrieval, BM25, BM25 parameters, fielded BM25, and comparison between TF-IDF and BM25.
  5. Evaluation of Information Retrieval systems. Test collections, topics, queries, qrels, relevance judgments, and standard IR evaluation measures.
  6. User interaction, personalization, and Web search. Query reformulation, search sessions, click behavior, search logs, personalization, exploratory search, crawling, Web indexing, link analysis, PageRank, spam detection, freshness, and snippets.
  7. Domain-specific search and Learning to Rank. Scientific search, biomedical search, legal search, enterprise search, e-commerce search, domain terminology, domain constraints, learning to rank (pointwise, pairwise, and listwise approaches), ranking features, LambdaMART, and click-based learning.
  8. Neural representations and dense retrieval. Word embeddings, contextual embeddings, sentence embeddings, document embeddings, transformer-based representations, bi-encoders, and vector databases.
  9. Sparse, dense, hybrid, and multi-stage neural retrieval. Learned sparse retrieval, neural lexical matching, SPLADE-style methods, hybrid sparse-dense retrieval, score fusion, candidate generation, neural reranking, cross-encoders, late interaction models, ColBERT-style ranking, and efficiency-effectiveness tradeoffs.
  10. LLM-based, RAG, and agentic search systems. Query rewriting, query expansion, synthetic query generation, LLM-based reranking, result summarization, answer generation, RAG architecture, chunking, context assembly, grounding, citation generation, hallucination control, evaluation of RAG systems, tool use, agentic search, memory, Web agents, and open research challenges.

Prerequisites

Basic knowledge of statistics, linear algebra, and programming (e.g. Python) is required.

Teaching form

The course will be taught in English and includes both lectures and laboratory exercises.
The course includes 40 hours of lectures and 12 hours of laboratory exercises.
Most lectures last 2 hours, although some intensive lectures may last 3 hours depending on the topic.

Lectures are delivered through a combination of teaching formats.
* The first part of each lecture is mainly based on frontal teaching and introduces theoretical concepts, formal models, and technical methods.
* The second part includes interactive teaching activities, such as guided discussion, examples, short exercises, and analysis of practical cases, in order to encourage active student participation and support the application of the concepts introduced during the lecture.

During the laboratory sessions, students will use open-source software to design, implement, and evaluate Information Retrieval components.
Seminars led by internationally recognized experts will be organized.
Some lectures may be delivered remotely in an interactive lecture format.

Textbook and teaching resource

  • Christopher D. Manning, Prabhakar Raghavan, and Hinrich Schütze. Introduction to Information Retrieval. Cambridge University Press, 2008.
  • Bhaskar Mitra and Nick Craswell. An Introduction to Neural Information Retrieval. Foundations and Trends in Information Retrieval, Volume 13, Issue 1, 2018.

Semester

First semester.

Assessment method

  • Individual written examination composed of exercises, open questions, and closed questions related to the course content.
  • The assessment also includes a laboratory project, which may be developed individually or in groups of up to three students.
  • The written examination is aimed at assessing the level of understanding of the basic theoretical and technical aspects taught during the course.
  • The goal of the project is to use open-source software to develop technological solutions to search problems addressed in the course.
  • The project will focus on real application scenarios that require students to design, implement, and evaluate Information Retrieval components introduced during the course.

Office hours

To be agreed with the teacher.

Enter

Key information

Field of research
INF/01
ECTS
6
Term
First semester
Activity type
Mandatory to be chosen
Course Length (Hours)
52
Degree Course Type
2-year Master Degree
Language
English

Staff

    Teacher

  • GP
    Georgios Peikos

Students' opinion

View previous A.Y. opinion

Bibliography

Find the books for this course in the Library

Enrolment methods

Manual enrolments
Self enrolment (Student)

You are not logged in. (Log in)
Policies
Get the mobile app
Powered by Moodle
© 2026 Università degli Studi di Milano-Bicocca
  • Privacy policy
  • Accessibility
  • Statistics