(self, image_size, num_channels, patch_size, hidden_size,
num_attention_heads, max_position_embeddings, norm_epsilon,
intermediate_size, hidden_act, num_hidden_layers, require_ln_f,
mapping: Mapping, dtype)
| 167 | class CLIPVisionTransformer(Module): |
| 168 | |
| 169 | def __init__(self, image_size, num_channels, patch_size, hidden_size, |
| 170 | num_attention_heads, max_position_embeddings, norm_epsilon, |
| 171 | intermediate_size, hidden_act, num_hidden_layers, require_ln_f, |
| 172 | mapping: Mapping, dtype) -> None: |
| 173 | super().__init__() |
| 174 | self.hidden_size = hidden_size |
| 175 | self.dtype = dtype |
| 176 | self.mapping = mapping |
| 177 | |
| 178 | self.embeddings = CLIPVisionEmbeddings(image_size=image_size, |
| 179 | num_channels=num_channels, |
| 180 | patch_size=patch_size, |
| 181 | hidden_size=hidden_size, |
| 182 | dtype=self.dtype) |
| 183 | self.pre_layernorm = LayerNorm(normalized_shape=self.hidden_size, |
| 184 | eps=norm_epsilon, |
| 185 | dtype=self.dtype) |
| 186 | |
| 187 | self.encoder = CLIPEncoder( |
| 188 | hidden_size=self.hidden_size, |
| 189 | num_attention_heads=num_attention_heads, |
| 190 | max_position_embeddings=max_position_embeddings, |
| 191 | norm_epsilon=norm_epsilon, |
| 192 | intermediate_size=intermediate_size, |
| 193 | hidden_act=hidden_act, |
| 194 | num_hidden_layers=num_hidden_layers, |
| 195 | mapping=self.mapping, |
| 196 | dtype=self.dtype) |
| 197 | |
| 198 | self.ln_f = None |
| 199 | |
| 200 | if require_ln_f: |
| 201 | self.ln_f = LayerNorm(normalized_shape=self.hidden_size, |
| 202 | eps=norm_epsilon, |
| 203 | dtype=self.dtype) |
| 204 | |
| 205 | def forward(self, pixel_values): |
| 206 | hidden_states = self.embeddings(pixel_values) |
nothing calls this directly
no test coverage detected