|
|
关于MongoDB,我们能看到的资料,基本都是在指导大家如何使用MongoDB,但是,MongoDB内部是如何运作的,资料不是很多。' T0 F7 e& C0 W
- Z$ m! a% v9 [8 M8 d6 a
阅读使用手册,会有很多疑惑之处。例如,有人说,MongoDB 等同于分布式的 MySQL。它把一个Table ,按 row,分割成多个Shards,分别存放在不同的 Servers 上。这种说法是否正确?
' H% w- o. X) |% U4 ~9 {
4 l$ t/ r3 E5 G1 \' N2 m9 d H 不深入了解 MongoDB 的内部结构,就无法透彻地回答类似问题。这个系列文章,就来和大家探讨MongoDB的内部的工作方式。
, U* l3 M3 k: z) `; r" W2 Y* r! L9 R2 O- X( v) M- h
/ S% h( x3 J9 c# G
$ O& f4 W( ?- _4 ~. U) F+ v+ q
图1-1 MongoDB架构图 F; |+ A. R6 ^% J- M7 ^
$ O& o6 j: Y" W( }* k+ ^3 B! h4 ^8 V MongoDB 通常运行在一个服务器集群上,而不是一个单机。图1-1,描述了一个MongoDB集群的基本组成部分,包括若干shards,至少一个config server,至少一个routing servers(又称 mongos)。
! a5 Q! V& J8 d1 A3 I
7 i7 L9 c- W+ @) L0 r' VShards0 h% i6 g" k, j( q! h: O
0 K! \3 _* z1 ^# |' |% g
MongoDB的最基本的数据单元,叫document,类似于关系式数据库中的行 row。一系列documents,组成了一个collection,相当于关系式数据库中的table。当一个 collection 数据量太大时,可以把该collection按documents切分,分成多个数据块,每个数据块叫做一个chunk,多个chunks聚集在一起,组成了一个shard。& H% p& @+ {2 ^# R8 I/ i
! U' @. c. N; f Sharding 的意义,不仅保障了数据库的扩容(scalability),同时也保障了系统的负载均衡(load balance)。
. u! R9 V# j+ ^) s0 v, K k9 H& p5 a$ r2 A- {' U" q2 }3 i
每一个shard存储在一个物理服务器(server)上。Server上运行着mongod进程,通过这个进程,对shard中的数据进行操作,主要是增删改查。
T. F" K7 t1 |- p& b9 w1 ]' \2 |- M% m/ b- o3 A
如果系统中的每个shard,只存储了一份数据,没有备份,那么当这个shard所在的server挂了,数据就丢失了。在生产环境中,为了保证数据不丢失,为了提高系统的可用性(availability),每一个shard被存储多份,每个备份所在的servers,组成了一个replica set。5 o- v+ c7 A1 t/ j+ R4 Z
% `6 U: g9 v; I7 h0 E
Shard keys" A* ] L( r; ?) V5 A7 }3 r
, L/ y7 ]/ i$ D
为了把collection切分成不同的chunks,从而存放到不同的shards中,我们需要制定一个切分的方式。
6 ?) `4 n0 j# k/ H7 o# Q4 Q) E' N6 Q0 Y, ]8 r1 M& C
如前所述,在 MongoDB 数据库中,一个表collection由多个行 documents 组成,而每个 document,有多个属性 fields。同一个 collection 中的不同的 documents,可能会有不同的 fields。例如,有个 collection 叫 Media,包含两条 documents,6 C$ i" X9 q; v) ~ A# D* @
, {# e) g8 w6 L: N3 v; `
{
9 i; [8 a$ Z$ q% r7 W3 Z "ISBN": "987-30-3652-5130-82"," @4 |; E# X! q5 ~! ]" F
"Type": "CD",
& f/ B7 L: `, v- w6 x* W+ ]: [; p* P "Author": "Nirvana",5 x( |! P. x' P+ i/ _# c
"Title": "Nevermind",
1 R1 g) r5 O3 v. e7 ?2 ] "Genre": "Grunge",4 H4 F. M/ g5 d0 [" a: J
"Releasedate": "1991.09.24",, e( ]/ ]) _9 P/ L$ ?# w
"Tracklist": [
4 P' J9 a9 u/ V. d0 B0 p( Y {
0 `! Z+ R" i! k, }# l "Track" : "1",
5 g! x. w3 c8 y" k: e "Title" : "Smells like teen spirit",+ K$ K* ?5 O/ e: Y3 _# u5 G; ^
"Length" : "5:02") ]/ }( I8 M! w4 N6 I- r: `
},
& J# _: |# N. U {
7 A/ |( n1 E$ f8 d. o: h* b "Track" : "2",
6 D7 r6 A, r& }5 Y" ^1 z "Title" : "In Bloom",
q' `% N$ e. A6 V, | "Length" : "4:15", D+ v, i t. M- a
}: M/ b- A6 Y0 T) ]% q
]
6 }1 N9 [$ r; \2 s4 h}' M# |* v: w5 [' w0 R
( I; J. H' q8 \{" t. }6 X- K/ y8 K6 X T. ~& ^
"ISBN": "987-1-4302-3051-9",
4 M- M+ q; D" K2 d0 f6 A7 @ "Type": "Book",
) G3 [/ Y$ T: X! j2 k4 z4 G "Title": "Definite Guide to MongoDB: The NoSQL Database",
+ m! j# X% K4 ?5 w "Publisher": "Apress",
4 t6 S. ~: D/ `9 E6 |2 a# q0 P "Author": " Eelco Plugge",4 P* o f. Y a. N+ C, j0 I
"Releasedate": "2011.06.09"" o, J1 A: ]) R( i
}7 O" r6 O. Z$ [3 a
( S* F$ S1 z. j e0 [' l6 z
假如,在同一个 collection 中的所有 document,都包含某个共同的 field,例如前例中的“ISBN”,那么我们就可以按照这个 field 的值,来分割 collection。这个 field 的值,又称为 shard key。+ C, K5 C3 t5 C5 d) D* x/ a3 U" Y
7 y: P- n" p% ?, {
在选择shard key的时候,一定要确保这个key能够把collection均匀地切分成很多chunks。5 _7 |$ } w- x) |
" K/ x9 x4 s. w j
例如,如果我们选择“author”作为shard key,如果有大量的作者是重名的,那么就会有大量的数据聚集在同一个chunk中。当然,假设很少有作者同名同姓,那么“author”也可以作为一个shard key。换句话说,shard key 的选择,与使用场景密切相关。
4 J5 h4 t) B, W l \" o- B, r, n7 [( G* v+ W% w. p+ d
很多情况下,无论选择哪一个单一的 field 作为shard key,都无法均匀分割 collection。在这种情况下,我们可以考虑,用多个 fields,构成一个复合的shard key。
. r1 Z! r' t; S$ ]1 r
7 i: G7 f u# @5 [9 H 延续前例,假如有很多作者同名同姓,他们都叫“王二”。用 author 作为 shard key,显然无法均匀切割 collection。这时我们可以加上release-date,组成name-date的复合 shard key,例如“王二 2011”。
7 I' E: q3 K+ Z7 \; @$ D4 R* e2 X0 p% a" a# i
Chunks
) t3 a' |3 P( Z2 t
' ]4 C6 G+ p; E% d R+ y* x MongoDB按 shard key,把 collection切割成若干 chunks。每个 chunk 的数据结构,是一个三元组,{collection,minKey,maxKey},如图1-2 所示。
6 C2 v6 g" h( C1 k5 w b2 `7 s
% z7 g+ e1 H7 P. O
8 b2 B) @9 W$ n# |- l# q4 Z( f2 ~
图1-2 chunk的三元组 9 f! d, o8 m( m1 W) U: m% a# p
2 U2 ?% R8 Q" Z8 ]+ u
其中,collection 是数据库中某一个表的名称,而 minKey 和 maxKey 是 shard key的范围。每一个 document 的shard key 的值,决定了这条document应该存放在哪个chunk中。3 r1 n* r/ E* p
7 q {( a5 W- j _' ]- ?1 U 如果两条 documents 的 shard keys 的值很接近,这两条 documents 很可能被存放在同一个 chunk 中。+ f8 E. L+ }5 X% w
2 u& J- l: d! ^: x7 G; I
Shard key 的值的顺序,决定了 document 存放的 chunk。在 MongoDB 的文献中,这种切割 collection 的方式,称为order-preserving。
f( g; G F2 c7 P! s. R& E" E, Y$ d* u% G! }; K
一个 chunk最多能够存储64MB的数据。 当某个chunk存储的 documents包含的数据量,接近这个阈值时,一个chunk会被切分成两个新的chunks。* U/ I3 v j4 t9 d, w/ H
$ m! F. V3 E8 Z2 K% r# `8 \/ { 当一个shard存储了过多的chunks,这个shard中的某些chunks会被迁移到其它 shard中。! i: A/ j# v$ |. u
) [+ R8 ?& I% x 这里有个问题,假如某一条 document 包含的数据量很大,超过 64MB,一个 chunk 存放不下,怎么办?在后续章节介绍 GridFS 时,我们会详细讨论。4 Q2 C- q! ?" p* O9 s' t Z* [ M1 C( A
0 @$ O% }' e1 Y2 x# RReplica set1 k9 ~0 B7 E3 [7 x$ v( \
$ s# g' y. o) A" A/ Z 在生产环境中,为了保证数据不丢失,为了提高系统的可用性(availability),每一个shard被存储多份,每个备份所在的servers,组成了一个replica set。! }% |# w, a% Y. d
( B* k1 {2 O. F% e/ J# p/ _) F
这个replica set包括一个primary DB和多个secondary DBs。为了数据的一致性,所有的修改(insert / update / deletes) 请求都交给primary处理。处理结束之后,再异步地备份到其他secondary中。
: P* w1 ]# U8 u, ~& B+ |. |$ _4 ?0 E+ c! a
Primary DB由replica set中的所有servers,共同选举产生。当这个primaryDB server出错的时候,可以从replica set中重新选举一个新的primaryDB,从而避免了单点故障。
- F0 g8 Y8 N* ?
6 L5 {- m) o ^8 B' ?1 y Replica set的选举策略和数据同步机制,确保了系统的数据的一致性。后文详述。
2 S2 T; _% _$ Z# Y, O; O* U( f) B; M
Config Server* n2 _0 R% \# G2 u! x
9 T, [9 ?" v9 y8 {+ b Config servers用于存储MongoDB集群的元数据 metadata,这些元数据包括如下两个部分,每一个shard server包括哪些chunks,每个chunk存储了哪些 collections 的哪些 documents。
9 `6 k* q" J" R
3 b, H+ N% `6 @$ f 每一个config server都包括了MongoDB中所有chunk的信息。
% a1 h# C- d: h4 n% c7 L+ b& A& W
( T7 K+ M, ]+ M; G V Config server也需要 replication。但是有趣的是,config server 采用了自己独特的replication模式,而没有沿用 replica set。1 r; r* R/ O4 S) M
( }) ~3 J& U% G4 u, y
如果任何一台config server挂了,整个 config server 集群中,其它 config server变成只读状态。这样做的原因,是避免在系统不稳定的情况下,冒然对元数据做任何改动,导致在不同的 config servers 中,出现元数据不一致的情况。
; ~% {* }/ U, [: f- P9 ^6 W
& ?' R3 g7 s# q% C- U0 ]0 ?: w MongoDB的官方文档建议,配置3个config servers比较合适,既提供了足够的安全性,又避免了更多的config servers实例之间的数据同步,引起的元数据不一致的麻烦。/ O& G9 _6 M$ s; v1 f
6 v8 S+ G$ I0 T0 w8 B3 W5 B# B
Mongos% Z& ?4 _) j7 ^
% R8 G1 w: E( F5 a- M1 Z! m9 m5 ?
用户使用MongoDB 时,用户的操作请求,全部由mongos来转发。* ]8 s3 H$ g3 V# [" J8 S
0 U3 h6 N D$ A. D4 | 当 mongos 接收到用户请求时,它先查询 config server,找到存放相应数据的shard servers。然后把用户请求,转发到这些 shard servers。当这些 shard servers完成操作后,它们把结果分别返回给 mongos。而当 mongos 汇总了所有的结果后,它把结果返回给用户。
1 J) @2 w2 F, A
. V B: g* X5 k s. v Mongos每次启动的时候,都要到config servers中读取元数据,并缓存在本地。每当 config server中的元数据有改动,它都会通知所有的mongos。, t) Z; G3 S: A( m9 P
% C% p0 c8 d4 z/ _" C. y
Mongos之间,不存在彼此协同工作的问题。因此,MongoDB所需要配置的mongos server的数量,没有限制。6 r) {$ p2 d& I7 L1 p
1 D G$ l0 G0 H% T. u
通过以上的介绍,我们对每个组成部分都有了基本的了解,但是涉及到工作的细节,我们尚有诸多疑问,例如,一个chunk的数据太大,如何切分?一个shard数据太多,如何迁移?在replica set中,如何选择primary?server挂了,怎么进行故障恢复?接下来的章节,我们逐个回答这些问题。. w0 x/ ^8 y2 C$ Q
0 m7 n8 N% K# p% }6 a
( Z+ u' [$ z( W# SReference,
9 w9 K+ y y; ^. r' c4 N0 V/ @- {# \& V
[0] Architectural Overview
& T8 q% h% v8 Yhttp://www.mongodb.org/display/DOCS/Sharding+Introduction1 U0 N5 S5 ]- Y' T
|
评分
-
查看全部评分
|