feat: add tags_search and contributors_search fields to database

Schema changes:
- Add tags_search TEXT[] column for case-insensitive, punctuation-free search
- Add contributors_search TEXT[] column for case-insensitive, punctuation-free search
- Create GIN indexes for fast array searches on both search fields

Query updates:
- CreateMediaItem: Include tags_search and contributors_search parameters
- UpdateMediaItem: Include tags_search and contributors_search parameters
- SearchMediaItems: Search against tags_search instead of tags
- SearchMediaItems: Search against contributors_search instead of contributors
- SearchMediaItemsFuzzy: Use tags_search and contributors_search for fuzzy matching
- Update ranking and priority logic to use search fields

Benefits:
- Case-insensitive search: "acme corp" finds "ACME CORP."
- Punctuation-agnostic search: "oreilly" finds "O'Reilly Media"
- Better UX: Users don't need to match exact casing or punctuation
- Improved performance with dedicated GIN indexes

Relates to Tags & Contributors Migration Phases 5 & 8
This commit is contained in:
2026-02-08 11:05:18 -05:00
parent 08e823d6ab
commit c606a7ffcc
3 changed files with 473 additions and 413 deletions
+20 -18
View File
@@ -207,24 +207,26 @@ type MediaItems struct {
// Open Library identifier for integration // Open Library identifier for integration
OpenlibraryID pgtype.Text `db:"openlibrary_id" json:"openlibrary_id"` OpenlibraryID pgtype.Text `db:"openlibrary_id" json:"openlibrary_id"`
// Google Books identifier for integration // Google Books identifier for integration
GoogleBooksID pgtype.Text `db:"google_books_id" json:"google_books_id"` GoogleBooksID pgtype.Text `db:"google_books_id" json:"google_books_id"`
AddedByAdminID pgtype.UUID `db:"added_by_admin_id" json:"added_by_admin_id"` AddedByAdminID pgtype.UUID `db:"added_by_admin_id" json:"added_by_admin_id"`
CreatedAt pgtype.Timestamptz `db:"created_at" json:"created_at"` CreatedAt pgtype.Timestamptz `db:"created_at" json:"created_at"`
UpdatedAt pgtype.Timestamptz `db:"updated_at" json:"updated_at"` UpdatedAt pgtype.Timestamptz `db:"updated_at" json:"updated_at"`
FormatGroup string `db:"format_group" json:"format_group"` FormatGroup string `db:"format_group" json:"format_group"`
FormatMimetype pgtype.Text `db:"format_mimetype" json:"format_mimetype"` FormatMimetype pgtype.Text `db:"format_mimetype" json:"format_mimetype"`
IsReflowable pgtype.Bool `db:"is_reflowable" json:"is_reflowable"` IsReflowable pgtype.Bool `db:"is_reflowable" json:"is_reflowable"`
HasFixedLayout pgtype.Bool `db:"has_fixed_layout" json:"has_fixed_layout"` HasFixedLayout pgtype.Bool `db:"has_fixed_layout" json:"has_fixed_layout"`
TotalCharacters pgtype.Int8 `db:"total_characters" json:"total_characters"` TotalCharacters pgtype.Int8 `db:"total_characters" json:"total_characters"`
ChapterCount pgtype.Int4 `db:"chapter_count" json:"chapter_count"` ChapterCount pgtype.Int4 `db:"chapter_count" json:"chapter_count"`
EntitlementID pgtype.Text `db:"entitlement_id" json:"entitlement_id"` EntitlementID pgtype.Text `db:"entitlement_id" json:"entitlement_id"`
RevisionNumber pgtype.Int4 `db:"revision_number" json:"revision_number"` RevisionNumber pgtype.Int4 `db:"revision_number" json:"revision_number"`
KoboContentID pgtype.Text `db:"kobo_content_id" json:"kobo_content_id"` KoboContentID pgtype.Text `db:"kobo_content_id" json:"kobo_content_id"`
KoboMetadata []byte `db:"kobo_metadata" json:"kobo_metadata"` KoboMetadata []byte `db:"kobo_metadata" json:"kobo_metadata"`
FileSha256 pgtype.Text `db:"file_sha256" json:"file_sha256"` TagsSearch []string `db:"tags_search" json:"tags_search"`
OpfIdentifier pgtype.Text `db:"opf_identifier" json:"opf_identifier"` ContributorsSearch []string `db:"contributors_search" json:"contributors_search"`
OpfUuid pgtype.Text `db:"opf_uuid" json:"opf_uuid"` FileSha256 pgtype.Text `db:"file_sha256" json:"file_sha256"`
HashConfidence pgtype.Text `db:"hash_confidence" json:"hash_confidence"` OpfIdentifier pgtype.Text `db:"opf_identifier" json:"opf_identifier"`
OpfUuid pgtype.Text `db:"opf_uuid" json:"opf_uuid"`
HashConfidence pgtype.Text `db:"hash_confidence" json:"hash_confidence"`
} }
type MediaNotes struct { type MediaNotes struct {
File diff suppressed because it is too large Load Diff
+36 -34
View File
@@ -102,8 +102,8 @@ ORDER BY l.created_at DESC;
-- Media Items queries -- Media Items queries
-- name: CreateMediaItem :one -- name: CreateMediaItem :one
INSERT INTO media_items (library_id, title, author, isbn, description, file_path, file_size, mime_type, cover_image_path, series, series_number, tags, asin, date_published, publisher, contributors, language, edition, page_count, genre, copyright_year, goodreads_id, openlibrary_id, google_books_id, added_by_admin_id) INSERT INTO media_items (library_id, title, author, isbn, description, file_path, file_size, mime_type, cover_image_path, series, series_number, tags, tags_search, asin, date_published, publisher, contributors, contributors_search, language, edition, page_count, genre, copyright_year, goodreads_id, openlibrary_id, google_books_id, added_by_admin_id)
VALUES ($1, $2, $3, $4, $5, $6, $7, $8, $9, $10, $11, $12, $13, $14, $15, $16, $17, $18, $19, $20, $21, $22, $23, $24, $25) VALUES ($1, $2, $3, $4, $5, $6, $7, $8, $9, $10, $11, $12, $13, $14, $15, $16, $17, $18, $19, $20, $21, $22, $23, $24, $25, $26, $27)
RETURNING *; RETURNING *;
-- name: GetMediaItem :one -- name: GetMediaItem :one
@@ -252,18 +252,20 @@ UPDATE media_items SET
series = $7, series = $7,
series_number = $8, series_number = $8,
tags = $9, tags = $9,
asin = $10, tags_search = $10,
date_published = $11, asin = $11,
publisher = $12, date_published = $12,
contributors = $13, publisher = $13,
language = $14, contributors = $14,
edition = $15, contributors_search = $15,
page_count = $16, language = $16,
genre = $17, edition = $17,
copyright_year = $18, page_count = $18,
goodreads_id = $19, genre = $19,
openlibrary_id = $20, copyright_year = $20,
google_books_id = $21, goodreads_id = $21,
openlibrary_id = $22,
google_books_id = $23,
updated_at = NOW() updated_at = NOW()
WHERE id = $1 WHERE id = $1
RETURNING *; RETURNING *;
@@ -359,22 +361,22 @@ FROM media_items mi
JOIN libraries l ON mi.library_id = l.id JOIN libraries l ON mi.library_id = l.id
JOIN library_types lt ON l.library_type_id = lt.id JOIN library_types lt ON l.library_type_id = lt.id
LEFT JOIN library_visibility lv ON l.id = lv.library_id AND lv.user_id = sqlc.narg('user_id') LEFT JOIN library_visibility lv ON l.id = lv.library_id AND lv.user_id = sqlc.narg('user_id')
WHERE COALESCE(lv.is_visible, true) = true WHERE COALESCE(lv.is_visible, true) = true
AND ( AND (
mi.title ILIKE sqlc.narg('search_pattern') OR mi.title ILIKE sqlc.narg('search_pattern') OR
mi.author ILIKE sqlc.narg('search_pattern') OR mi.author ILIKE sqlc.narg('search_pattern') OR
mi.series ILIKE sqlc.narg('search_pattern') OR mi.series ILIKE sqlc.narg('search_pattern') OR
sqlc.narg('search_pattern') = ANY(mi.tags) OR sqlc.narg('search_pattern') = ANY(mi.tags_search) OR
sqlc.narg('search_pattern') = ANY(mi.contributors) sqlc.narg('search_pattern') = ANY(mi.contributors_search)
) )
ORDER BY ORDER BY
CASE CASE
WHEN mi.title ILIKE sqlc.narg('search_pattern') THEN 1 WHEN mi.title ILIKE sqlc.narg('search_pattern') THEN 1
WHEN mi.author ILIKE sqlc.narg('search_pattern') THEN 2 WHEN mi.author ILIKE sqlc.narg('search_pattern') THEN 2
WHEN mi.series ILIKE sqlc.narg('search_pattern') THEN 3 WHEN mi.series ILIKE sqlc.narg('search_pattern') THEN 3
WHEN sqlc.narg('search_pattern') = ANY(mi.tags) THEN 4 WHEN sqlc.narg('search_pattern') = ANY(mi.tags_search) THEN 4
ELSE 5 ELSE 5
END, END,
mi.title ASC mi.title ASC
LIMIT sqlc.narg('limit') OFFSET sqlc.narg('offset'); LIMIT sqlc.narg('limit') OFFSET sqlc.narg('offset');
@@ -390,12 +392,12 @@ WHERE COALESCE(lv.is_visible, true) = true
word_similarity(sqlc.narg('search_query'), COALESCE(mi.author, '')) > 0.3 OR word_similarity(sqlc.narg('search_query'), COALESCE(mi.author, '')) > 0.3 OR
word_similarity(sqlc.narg('search_query'), COALESCE(mi.series, '')) > 0.3 OR word_similarity(sqlc.narg('search_query'), COALESCE(mi.series, '')) > 0.3 OR
EXISTS ( EXISTS (
SELECT 1 FROM unnest(mi.tags) AS tag SELECT 1 FROM unnest(mi.tags_search) AS tag
WHERE word_similarity(sqlc.narg('search_query'), tag) > 0.3 WHERE word_similarity(sqlc.narg('search_query'), tag) > 0.3
LIMIT 1 LIMIT 1
) OR ) OR
EXISTS ( EXISTS (
SELECT 1 FROM unnest(mi.contributors) AS contributor SELECT 1 FROM unnest(mi.contributors_search) AS contributor
WHERE word_similarity(sqlc.narg('search_query'), contributor) > 0.3 WHERE word_similarity(sqlc.narg('search_query'), contributor) > 0.3
LIMIT 1 LIMIT 1
) )
@@ -407,12 +409,12 @@ WHERE COALESCE(lv.is_visible, true) = true
word_similarity(sqlc.narg('search_query'), COALESCE(mi.series, '')), word_similarity(sqlc.narg('search_query'), COALESCE(mi.series, '')),
COALESCE( COALESCE(
(SELECT MAX(word_similarity(sqlc.narg('search_query'), tag)) (SELECT MAX(word_similarity(sqlc.narg('search_query'), tag))
FROM unnest(mi.tags) AS tag), FROM unnest(mi.tags_search) AS tag),
0 0
), ),
COALESCE( COALESCE(
(SELECT MAX(word_similarity(sqlc.narg('search_query'), contributor)) (SELECT MAX(word_similarity(sqlc.narg('search_query'), contributor))
FROM unnest(mi.contributors) AS contributor), FROM unnest(mi.contributors_search) AS contributor),
0 0
) )
) DESC, ) DESC,