MySQL面試題講解之如何設置Hash索引

除瞭B-Tree 索引,MySQL還提供瞭如下索引:

  • Hash索引

隻有Memory引擎支持,場景簡單

  • R-Tree索引

MyISAM的一個特殊索引類型,主要用於地理空間數據類型

  • Full-text

MyISAM的一個特殊索引,主要用於全文索引,從MySQL 5.6開始InnoDB支持全文索引

索引 / 存儲引擎MyISAMInnoDBMemoryB-Tree索引支持支持支持HASH索引不支持不支持支持R-Tree索引支持支持不支持Full-text索引支持支持不支持

最常用的索引也就是B-tree索引和Hash索引,且隻有Memory, NDB兩種引擎支持Hash索引。 Hash索引適於key-value查詢,通過Hash索引比B-tree索引查詢更加迅速。但Hash索引不支持范圍查找例如<><==,>==等。 Memory隻有在”=”的條件下才會使用hash索引

MySQL在 8.0才支持函數索引,在此之前隻能對列的前面某一部分進行索引,例如標題title字段,可以隻取title的前10個字符索引,這樣的特性大大縮小瞭索引文件的大小,但前綴索引也有缺點,在order by和group by操作時失效。

create index idx_title on film(title(10));

1 特點

隻存在數組,用一個hash函數把key轉換成一個確定的內存位置,然後把value放在數組的該位置。使用 hash 自然會有哈希沖突可能,MySQL 采取拉鏈法解決。

Hash索引基於Hash表實現,隻有查詢條件精確匹配Hash索引中的列時,才能夠使用到hash索引。對於Hash索引中的所有列,存儲引擎會為每行計算一個hashcode,Hash索引中存儲的就是hashcode。

  • 例如一個維護瞭身份證號和姓名的表,根據身份證號查找對應名字,其hash索引如下:

阿裡面試官:設計個MySQL的Hash索引吧?

比如我們想查ID_card_n4對應username:

  • 將ID_card_n4通過hash函數算出A
  • 按順序遍歷,找到User4

四個ID_card_n值並不一定遞增,這樣即使增加新的User,速度也快,隻需在後追加。 當然缺點也很明顯,不是有序,所以hash索引做區間查詢速度很慢。比如要找身份證號在[ID_card_X, ID_card_Y]區間的所有用戶,就須全表掃描。

2 Hash索引的缺陷

  • 必須二次查找
  • 不支持部分索引查找、范圍查找
  • 哈希碼可能存在哈希沖突,如果hash 算法設計不好,碰撞過多,性能也會變差
  • 索引存放的是hash值,所以僅支持 < = > 以及 IN
  • 無法通過操作索引來排序,因為存放的時候會經過hash計算,但是計算的hash值和存放的不一定相等,所以無法排序
  • 不能避免全表掃描,隻是由於在memory表裡支持非唯一值hash索引,即不同的索引鍵,可能存在相同hash值
  • 因為哈希表是一種根據關鍵字直接訪問內存存儲位置的數據結構 ,所以利用其原理的hash 索引,也就需要將所有數據文件添加到內存,這就很耗內存
  • 如果所有的查詢都是等值查詢,那麼hash確實快,但實際上范圍查找數據更多
  • 智能處理鍵值得全值匹配
  • 查詢Hash函數決定著索引鍵的大小

要使InnoDB或MyISAM支持哈希索引,可以通過偽哈希索引來實現,叫自適應哈希索引。

可通過增加一個字段,存儲hash值,將hash值建立索引,在插入和更新的時候,建立觸發器,自動添加計算後的hash到表裡。

哈希表這種結構適用於隻有等值查詢的場景,比如Memcached。

3 案例應用

假如有一個非常非常大的表,比如用戶登錄時需要通過email檢索出用戶,如果直接在email列建索引,除瞭索引區間匹配,還要進行字符串匹配比對,email短還好,如果長的話這個查詢代價就比較大。 若此時,在email建立哈希索引,查詢以int查詢,性能就比字符串比對查詢快多瞭。

Hash 算法

建立哈希索引,首先就要選定哈希算法,《高性能MySQL》說到的CRC32算法。

INSERT UPDATE SELECT 操作

在表中添加hash值的字段:

ALTER TABLE `User` ADD COLUMN email_hash int unsigned NOT NULL DEFAULT 0;

接下來就是在UPDATE和INSERT時,自動更新 email_hash 字段,通過觸發器實現:

DELIMITER |
CREATE TRIGGER user_hash_insert BEFORE INSERT ON `User` FOR EACH ROW BEGIN
SET NEW.email_hash=crc32(NEW.email);
END;
|
CREATE TRIGGER user_hash_update BEFORE UPDATE ON `User` FOR EACH ROW BEGIN
SET NEW.email_hash=crc32(NEW.email);
END;
|
DELIMITER ;

這樣SELECT請求就會變成:

SELECT `email`, `email_hash` FROM `User` WHERE 
	email_hash = CRC32(“[email protected]”) 
			AND `email`= “[email protected]”;

+—————————-+————+
| email                    |  email_hash  |
+—————————-+————+
| [email protected] | 2765311122 |
+—————————-+————+

AND email = “[email protected]” 是為瞭防止哈希碰撞時數據不準確。

到此這篇關於MySQL面試題講解之如何設置Hash索引的文章就介紹到這瞭,更多相關MySQL 設置Hash索引內容請搜索WalkonNet以前的文章或繼續瀏覽下面的相關文章希望大傢以後多多支持WalkonNet!

推薦閱讀: