Repository Analysis

huggingface/sentence-transformers

State-of-the-Art Embeddings, Retrieval, and Reranking

26.8 Moderate AI signal View on GitHub

Analysis Overview

This report presents the forensic synthetic code analysis of huggingface/sentence-transformers, a Python project with 19,045 GitHub stars. SynthScan v2.0 examined 137,472 lines of code across 683 source files, recording 3094 pattern matches distributed across 18 syntactic categories. The overall adjusted score of 26.8 places this repository in the Moderate AI signal band.

The scanner applied 160+ deterministic lexical heuristics, multi-line block detectors, abstract syntax tree depth profilers, and a cross-file Jaccard similarity matrix to construct a statistically normalised synthetic code estimate. All matches are individually weighted by severity coefficient and contextual multiplier before summation, and the resulting headline score is temporally discounted to account for the repository's development history relative to the commercial emergence of large language model coding tooling (November 2022 onward).

26.8
Adjusted Score
26.8
Raw Score
100%
Time Factor
2026-08-27
Last Push
19.0K
Stars
Python
Language
137.5K
Lines of Code
683
Files
3.1K
Pattern Hits
2026-08-29
Scan Date
0.20
HC Hit Rate

What These Metrics Mean

Adjusted Score
Primary synthetic code indicator. Raw score normalised per 1,000 lines of code and multiplied by the temporal discount factor. This is the definitive comparative metric — use it to rank repositories by AI authorship density.
Raw Score
The unmodified sum of all severity-weighted, context-multiplied pattern match scores before temporal discounting. Reflects the absolute signal strength independent of when the repository was last active.
Time Factor
The temporal discount multiplier (0–100%) applied to the raw score. Repositories last updated before ChatGPT's launch (Nov 2022) receive a 5% factor. Full signal is only assigned to repositories active in the post-adoption era (Jan 2024+).
Pattern Hits
Total count of individual pattern matches across all files and categories. A high hit count with a low score may indicate a very large codebase with isolated AI snippets; a low count with a high score indicates dense, concentrated AI signatures.
HC Hit Rate
High+Critical pattern hits per file, averaged across the repository. This orthogonal signal catches repositories where a few files are densely packed with high-severity AI tells — a strong indicator even when the normalised score appears moderate due to codebase size.
Lines of Code / Files
Total lines and files analysed. The scanner examines 94 file extensions. These denominators are used to normalise the score, enabling fair comparison between repositories of vastly different sizes.

Score History

This chart maps the temporal evolution of the adjusted synthetic code score across successive scan runs. An upward trajectory indicates ongoing incorporation of AI-generated code or expanding LLM-assisted scaffolding; a stable or declining trajectory may reflect active human refactoring, code removal, or the adoption of stricter authorship policies. The dashed secondary line (right axis) independently tracks total raw pattern hit count, which can diverge from the normalised score when codebase size changes significantly between scans.

Severity Breakdown

Classifies detected patterns by their diagnostic confidence and structural impact. CRITICAL patterns (coefficient 10) represent definitive synthetic signatures — hallucinated imports, explicit LLM attribution metadata — virtually never produced by human authors. HIGH (5) indicates strong structural tells such as cross-file repetition or cross-linguistic idioms. MEDIUM (2) covers recognisable conversational padding and AI-specific vocabulary. LOW (1) captures subtle indicators like tautological comments and generic boilerplate that require density to carry independent signal.

CRITICAL 0HIGH 136MEDIUM 124LOW 2834

Directory Score Breakdown

This horizontal bar chart decomposes the repository's raw synthetic code score by top-level directory, allowing you to pinpoint precisely which modules or components carry the highest AI authorship density. Directories with disproportionately high scores relative to their size warrant targeted manual review: concentrated AI signatures often trace back to mass-generated configuration layers, auto-ported test suites, LLM-scaffolded boilerplate classes, or entire subsystems authored under heavy copilot assistance. Use this view to prioritise your human code-review effort.

Pattern Findings

The scanner identified 3094 distinct pattern matches across 18 syntactic categories. Each entry below represents a discrete location in the source code where the engine recorded a statistically significant AI authorship indicator. Expand any category row to inspect the individual file paths, line numbers, code snippets, and the lexical context (CODE, COMMENT, or STRING) in which each match was detected.

Reading the findings table: The Severity column indicates the diagnostic confidence level (CRITICAL / HIGH / MEDIUM / LOW). The Context column identifies whether the match occurred inside executable code, an inline comment, or a string literal — comment-context matches receive a ×1.5 weight because LLMs systematically over-annotate. The ⚡ bolt icon marks clustered matches: three or more patterns within a 10-line window, each receiving an additional ×1.5 density multiplier as dense clusters constitute far stronger evidence of synthetic authorship than isolated hits.

Hyper-Verbose Identifiers1550 hits · 1406 pts
SeverityFileLineSnippetContext
LOW…entence_transformer/deprecated_model_card_templates.py125 def model_card_get_pooling_function(pooling_mode):STRING
LOWsentence_transformers/sentence_transformer/model.py1221 def set_pooling_include_prompt(self, include_prompt: bool) -> None:CODE
LOWsentence_transformers/sentence_transformer/model.py1267 def get_sentence_embedding_dimension(self) -> int | None:CODE
LOWsentence_transformers/sentence_transformer/model.py1305 def truncate_sentence_embeddings(self, truncate_dim: int | None) -> Iterator[None]:CODE
LOW…ntence_transformers/sentence_transformer/model_card.py129 def get_model_specific_metadata(self) -> dict[str, Any]:CODE
LOW…sentence_transformer/losses/batch_semi_hard_triplet.py107 def compute_loss_from_embeddings(self, embeddings: list[Tensor], labels: Tensor) -> Tensor:CODE
LOW…sentence_transformer/losses/batch_semi_hard_triplet.py113 def batch_semi_hard_triplet_loss(self, labels: Tensor, embeddings: Tensor) -> Tensor:CODE
LOW…tence_transformer/losses/multiple_negatives_ranking.py237 def compute_loss_from_embeddings(self, embeddings: list[Tensor], labels: Tensor) -> Tensor:CODE
LOW…rmers/sentence_transformer/losses/batch_all_triplet.py97 def compute_loss_from_embeddings(self, embeddings: list[Tensor], labels: Tensor) -> Tensor:CODE
LOW…ransformers/sentence_transformer/losses/contrastive.py103 def compute_loss_from_embeddings(self, embeddings: list[Tensor], labels: Tensor) -> Tensor:CODE
LOW…ence_transformers/sentence_transformer/losses/angle.py83 def compute_loss_from_embeddings(CODE
LOW…transformer/losses/global_orthogonal_regularization.py140 def compute_loss_from_embeddings(CODE
LOW…mers/sentence_transformer/losses/batch_hard_triplet.py154 def compute_loss_from_embeddings(self, embeddings: list[Tensor], labels: Tensor) -> Tensor:CODE
LOW…mers/sentence_transformer/losses/batch_hard_triplet.py231 def get_anchor_positive_triplet_mask(labels: Tensor) -> Tensor:CODE
LOW…mers/sentence_transformer/losses/batch_hard_triplet.py250 def get_anchor_negative_triplet_mask(labels: Tensor) -> Tensor:CODE
LOW…transformers/sentence_transformer/losses/margin_mse.py178 def compute_loss_from_embeddings(self, embeddings: list[Tensor], labels: Tensor) -> Tensor:CODE
LOW…mers/sentence_transformer/losses/online_contrastive.py82 def compute_loss_from_embeddings(self, embeddings: list[Tensor], labels: Tensor) -> Tensor:CODE
LOW…rmers/sentence_transformer/losses/cosine_similarity.py84 def compute_loss_from_embeddings(self, embeddings: list[Tensor], labels: Tensor) -> Tensor:CODE
LOW…/sentence_transformer/losses/denoising_auto_encoder.py16def _tie_encoder_decoder_weights(encoder: nn.Module, decoder: nn.Module) -> None:CODE
LOW…nce_transformers/sentence_transformer/losses/cosent.py87 def compute_loss_from_embeddings(self, embeddings: list[Tensor], labels: Tensor) -> Tensor:CODE
LOW…ce_transformers/sentence_transformer/losses/triplet.py88 def compute_loss_from_embeddings(self, embeddings: list[Tensor], labels: Tensor) -> Tensor:CODE
LOW…e_transformer/losses/batch_hard_soft_margin_triplet.py97 def compute_loss_from_embeddings(self, embeddings: list[Tensor], labels: Tensor) -> Tensor:CODE
LOW…e_transformer/losses/batch_hard_soft_margin_triplet.py102 def batch_hard_triplet_soft_margin_loss(self, labels: Tensor, embeddings: Tensor) -> Tensor:CODE
LOW…sformers/sentence_transformer/losses/distill_kl_div.py174 def compute_loss_from_embeddings(self, embeddings: list[Tensor], labels: Tensor) -> Tensor:CODE
LOW…rmers/sentence_transformer/losses/cached_gist_embed.py244 def calculate_loss_and_cache_gradients(CODE
LOW…nsformers/sentence_transformer/losses/embed_distill.py197 def compute_loss_from_embeddings(self, embeddings: list[Tensor], teacher_embeddings: list[Tensor]) -> Tensor:CODE
LOW…ntence_transformer/evaluation/binary_classification.py317 def find_best_acc_and_threshold(scores, labels, high_score_more_similar: bool):CODE
LOW…nsformers/sentence_transformer/evaluation/reranking.py292 def compute_metrics_individual(self, model: SentenceTransformer):CODE
LOW…ransformers/sentence_transformer/evaluation/triplet.py261 def _get_similarity_functions(self) -> dict:CODE
LOW…nsformers/sentence_transformer/evaluation/nano_beir.py468 def _load_dataset_subset_split(self, subset: str, split: str, required_columns: list[str]):CODE
LOW…nsformers/sentence_transformer/evaluation/nano_beir.py523 def store_metrics_in_model_card_data(self, *args, **kwargs):CODE
LOW…e_transformers/sentence_transformer/modules/pooling.py26def _convert_legacy_pooling_kwargs(kwargs: dict[str, Any]) -> None:CODE
LOW…e_transformers/sentence_transformer/modules/pooling.py46def _deprecated_pooling_mode_kwargs(func):CODE
LOW…e_transformers/sentence_transformer/modules/pooling.py154 def _exclude_prompt_from_mask(attention_mask: Tensor, prompt_length: int) -> Tensor:CODE
LOW…ransformers/sentence_transformer/modules/clip_model.py36 def _get_default_modality_config(config: dict[str, Any]) -> tuple[ModalityConfig, str]:CODE
LOWsentence_transformers/util/deprecated_import.py263def setup_deprecated_module_imports() -> None:CODE
LOWsentence_transformers/util/similarity.py505def _fill_empty_document_scores(scores: Tensor, empty: Tensor) -> Tensor:CODE
LOWsentence_transformers/util/similarity.py879 def to_similarity_pairwise_fn(CODE
LOWsentence_transformers/util/tensor.py265def stack_padded_token_embeddings(embeddings: list[Tensor], masks: list[Tensor]) -> tuple[Tensor, Tensor]:CODE
LOWsentence_transformers/util/tensor.py285def cat_padded_token_embeddings(embeddings: list[Tensor], masks: list[Tensor]) -> tuple[Tensor, Tensor]:CODE
LOWsentence_transformers/util/dataset.py56def _parse_string_encoded_lists(column: list, col_name: str) -> list:CODE
LOWsentence_transformers/util/retrieval.py89def paraphrase_mining_embeddings(CODE
LOWsentence_transformers/util/environment.py33def suggest_extra_on_exception() -> Generator[None, None, None]:CODE
LOWsentence_transformers/util/environment.py88def check_package_availability(package_name: str, owner: str) -> bool:CODE
LOWsentence_transformers/util/environment.py142def check_version_requirements(requirements: dict[str, Any] | None, source: str | None = None) -> None:CODE
LOWsentence_transformers/util/file_io.py34def is_sentence_transformer_model(CODE
LOWsentence_transformers/util/decorators.py53def transformer_kwargs_decorator(func):CODE
LOWsentence_transformers/util/decorators.py97def cross_encoder_init_args_decorator(func):CODE
LOWsentence_transformers/util/decorators.py170def cross_encoder_predict_rank_args_decorator(func: F) -> F:CODE
LOWsentence_transformers/util/decorators.py208def save_to_hub_args_decorator(func):CODE
LOW…_transformers/multi_vector_encoder/interpretability.py178def render_similarity_map_on_image(CODE
LOWsentence_transformers/multi_vector_encoder/model.py1169 def _load_module_class_from_ref(self, class_ref: str, *args: Any, **kwargs: Any) -> nn.Module:CODE
LOWsentence_transformers/multi_vector_encoder/model.py1175 def _get_module_init_defaults(self, class_ref: str) -> dict[str, Any]:CODE
LOWsentence_transformers/multi_vector_encoder/model.py1328 def _build_stanford_projection(CODE
LOWsentence_transformers/multi_vector_encoder/model.py1361 def _maybe_load_stanford_metadata(CODE
LOW…ntence_transformers/multi_vector_encoder/model_card.py88 def get_model_specific_metadata(self) -> dict[str, Any]:CODE
LOW…or_encoder/losses/cached_multiple_negatives_ranking.py270 def calculate_loss_and_cache_gradients(CODE
LOW…e_transformers/multi_vector_encoder/scoring/colbert.py166def mean_colbert_scores_pairwise(CODE
LOW…ransformers/multi_vector_encoder/evaluation/triplet.py65 def _get_similarity_functions(self) -> dict:CODE
LOWsentence_transformers/backend/optimize.py19def export_optimized_onnx_model(CODE
1490 more matches not shown…
Unused Imports680 hits · 632 pts
SeverityFileLineSnippetContext
LOWsentence_transformers/__init__.py1CODE
LOWsentence_transformers/__init__.py10CODE
LOWsentence_transformers/__init__.py10CODE
LOWsentence_transformers/__init__.py10CODE
LOWsentence_transformers/__init__.py15CODE
LOWsentence_transformers/__init__.py15CODE
LOWsentence_transformers/__init__.py16CODE
LOWsentence_transformers/__init__.py16CODE
LOWsentence_transformers/__init__.py16CODE
LOWsentence_transformers/__init__.py16CODE
LOWsentence_transformers/__init__.py22CODE
LOWsentence_transformers/__init__.py22CODE
LOWsentence_transformers/__init__.py22CODE
LOWsentence_transformers/__init__.py22CODE
LOWsentence_transformers/__init__.py28CODE
LOWsentence_transformers/__init__.py28CODE
LOWsentence_transformers/__init__.py29CODE
LOWsentence_transformers/__init__.py30CODE
LOWsentence_transformers/__init__.py31CODE
LOWsentence_transformers/__init__.py32CODE
LOWsentence_transformers/__init__.py33CODE
LOWsentence_transformers/__init__.py34CODE
LOWsentence_transformers/__init__.py34CODE
LOWsentence_transformers/__init__.py34CODE
LOWsentence_transformers/__init__.py34CODE
LOWsentence_transformers/__init__.py40CODE
LOWsentence_transformers/__init__.py40CODE
LOWsentence_transformers/__init__.py42CODE
LOWsentence_transformers/__init__.py43CODE
LOWsentence_transformers/__init__.py44CODE
LOW…entence_transformer/deprecated_model_card_templates.py6CODE
LOWsentence_transformers/sentence_transformer/__init__.py1CODE
LOWsentence_transformers/sentence_transformer/__init__.py3CODE
LOWsentence_transformers/sentence_transformer/__init__.py4CODE
LOWsentence_transformers/sentence_transformer/__init__.py5CODE
LOWsentence_transformers/sentence_transformer/__init__.py6CODE
LOWsentence_transformers/sentence_transformer/__init__.py7CODE
LOW…nce_transformers/sentence_transformer/training_args.py1CODE
LOW…nce_transformers/sentence_transformer/training_args.py5CODE
LOW…nce_transformers/sentence_transformer/training_args.py5CODE
LOWsentence_transformers/sentence_transformer/model.py1CODE
LOW…nce_transformers/sentence_transformer/data_collator.py1CODE
LOWsentence_transformers/sentence_transformer/trainer.py1CODE
LOWsentence_transformers/sentence_transformer/fit_mixin.py1CODE
LOW…ntence_transformers/sentence_transformer/model_card.py1CODE
LOW…sentence_transformer/losses/batch_semi_hard_triplet.py1CODE
LOW…/losses/cached_multiple_negatives_symmetric_ranking.py1CODE
LOW…ntence_transformers/sentence_transformer/losses/mse.py1CODE
LOW…tence_transformer/losses/multiple_negatives_ranking.py1CODE
LOW…transformers/sentence_transformer/losses/gist_embed.py1CODE
LOW…rmers/sentence_transformer/losses/batch_all_triplet.py1CODE
LOW…ransformers/sentence_transformer/losses/contrastive.py1CODE
LOW…ence_transformers/sentence_transformer/losses/angle.py1CODE
LOW…ransformer/losses/cached_multiple_negatives_ranking.py1CODE
LOW…ransformer/losses/cached_multiple_negatives_ranking.py11CODE
LOW…ransformer/losses/cached_multiple_negatives_ranking.py11CODE
LOW…ransformer/losses/cached_multiple_negatives_ranking.py11CODE
LOW…transformer/losses/global_orthogonal_regularization.py1CODE
LOW…mers/sentence_transformer/losses/batch_hard_triplet.py1CODE
LOW…transformers/sentence_transformer/losses/margin_mse.py1CODE
620 more matches not shown…
Cross-File Repetition115 hits · 575 pts
SeverityFileLineSnippetContext
HIGH…nce_transformers/sentence_transformer/training_args.py0basetrainingarguments extends :class:`~transformers.trainingarguments` with additional arguments specific to sentence trSTRING
HIGHsentence_transformers/sparse_encoder/training_args.py0basetrainingarguments extends :class:`~transformers.trainingarguments` with additional arguments specific to sentence trSTRING
HIGHsentence_transformers/base/training_args.py0basetrainingarguments extends :class:`~transformers.trainingarguments` with additional arguments specific to sentence trSTRING
HIGHsentence_transformers/sentence_transformer/trainer.py0basetrainer is a simple but feature-complete training and eval loop for pytorch based on the 🤗 transformers :class:`~traSTRING
HIGHsentence_transformers/cross_encoder/trainer.py0basetrainer is a simple but feature-complete training and eval loop for pytorch based on the 🤗 transformers :class:`~traSTRING
HIGHsentence_transformers/sparse_encoder/trainer.py0basetrainer is a simple but feature-complete training and eval loop for pytorch based on the 🤗 transformers :class:`~traSTRING
HIGHsentence_transformers/base/trainer.py0basetrainer is a simple but feature-complete training and eval loop for pytorch based on the 🤗 transformers :class:`~traSTRING
HIGH…sentence_transformer/losses/batch_semi_hard_triplet.py0batchhardsoftmargintripletloss takes a batch with (input, label) pairs and computes the loss for all possible, valid triSTRING
HIGH…mers/sentence_transformer/losses/batch_hard_triplet.py0batchhardsoftmargintripletloss takes a batch with (input, label) pairs and computes the loss for all possible, valid triSTRING
HIGH…e_transformer/losses/batch_hard_soft_margin_triplet.py0batchhardsoftmargintripletloss takes a batch with (input, label) pairs and computes the loss for all possible, valid triSTRING
HIGH…sentence_transformer/losses/batch_semi_hard_triplet.py0@misc{hermans2017defense, title={in defense of the triplet loss for person re-identification}, author={alexander hermansSTRING
HIGH…rmers/sentence_transformer/losses/batch_all_triplet.py0@misc{hermans2017defense, title={in defense of the triplet loss for person re-identification}, author={alexander hermansSTRING
HIGH…mers/sentence_transformer/losses/batch_hard_triplet.py0@misc{hermans2017defense, title={in defense of the triplet loss for person re-identification}, author={alexander hermansSTRING
HIGH…ce_transformers/sentence_transformer/losses/triplet.py0@misc{hermans2017defense, title={in defense of the triplet loss for person re-identification}, author={alexander hermansSTRING
HIGH…e_transformer/losses/batch_hard_soft_margin_triplet.py0@misc{hermans2017defense, title={in defense of the triplet loss for person re-identification}, author={alexander hermansSTRING
HIGH…transformers/sentence_transformer/losses/margin_mse.py0@misc{hofstaetter2020improving, title={improving efficient neural ranking models with cross-architecture knowledge distiSTRING
HIGH…ntence_transformers/cross_encoder/losses/margin_mse.py0@misc{hofstaetter2020improving, title={improving efficient neural ranking models with cross-architecture knowledge distiSTRING
HIGH…transformers/multi_vector_encoder/losses/margin_mse.py0@misc{hofstaetter2020improving, title={improving efficient neural ranking models with cross-architecture knowledge distiSTRING
HIGH…ransformers/sentence_transformer/datasets/sentences.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…tence_transformer/datasets/no_duplicates_dataloader.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…transformers/sentence_transformer/datasets/__init__.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…_transformers/sentence_transformer/readers/__init__.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…ormers/sentence_transformer/datasets/sentence_label.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…rs/sentence_transformer/datasets/parallel_sentences.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…_transformers/sentence_transformer/readers/nli_data.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…_transformers/sentence_transformer/readers/sts_data.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…nsformers/sentence_transformer/readers/paired_files.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…sformers/sentence_transformer/readers/input_example.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…formers/sentence_transformer/readers/label_sentence.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…e_transformers/sentence_transformer/readers/triplet.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…entence_transformer/datasets/denoising_auto_encoder.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…ransformers/sentence_transformer/modules/clip_model.py0get the default modality configuration for the current transformer task. returns: tuple[modalityconfig, str]: a tuple ofSTRING
HIGH…transformers/sparse_encoder/modules/mlm_transformer.py0get the default modality configuration for the current transformer task. returns: tuple[modalityconfig, str]: a tuple ofSTRING
HIGHsentence_transformers/base/modules/transformer.py0get the default modality configuration for the current transformer task. returns: tuple[modalityconfig, str]: a tuple ofSTRING
HIGHsentence_transformers/cross_encoder/losses/rank_net.py0get configuration parameters for this loss function. returns: dictionary containing the configuration parametersSTRING
HIGHsentence_transformers/cross_encoder/losses/list_net.py0get configuration parameters for this loss function. returns: dictionary containing the configuration parametersSTRING
HIGHsentence_transformers/cross_encoder/losses/plist_mle.py0get configuration parameters for this loss function. returns: dictionary containing the configuration parametersSTRING
HIGHsentence_transformers/cross_encoder/losses/list_mle.py0get configuration parameters for this loss function. returns: dictionary containing the configuration parametersSTRING
HIGH…tence_transformers/cross_encoder/losses/lambda_loss.py0get configuration parameters for this loss function. returns: dictionary containing the configuration parametersSTRING
HIGHsentence_transformers/cross_encoder/losses/adr_mse.py0compute lambdaloss for a batch of queries and their documents. args: inputs: list of (queries, documents_list) labels: gSTRING
HIGHsentence_transformers/cross_encoder/losses/list_net.py0compute lambdaloss for a batch of queries and their documents. args: inputs: list of (queries, documents_list) labels: gSTRING
HIGHsentence_transformers/cross_encoder/losses/plist_mle.py0compute lambdaloss for a batch of queries and their documents. args: inputs: list of (queries, documents_list) labels: gSTRING
HIGH…tence_transformers/cross_encoder/losses/lambda_loss.py0compute lambdaloss for a batch of queries and their documents. args: inputs: list of (queries, documents_list) labels: gSTRING
HIGHtests/sentence_transformer/test_model_card.py0dummy dataset for testing purposes. the dataset looks as follows: { "anchor": ["anchor 1", "anchor 2", ..., "anchor 10"]STRING
HIGHtests/cross_encoder/test_model_card.py0dummy dataset for testing purposes. the dataset looks as follows: { "anchor": ["anchor 1", "anchor 2", ..., "anchor 10"]STRING
HIGHtests/sparse_encoder/test_model_card.py0dummy dataset for testing purposes. the dataset looks as follows: { "anchor": ["anchor 1", "anchor 2", ..., "anchor 10"]STRING
HIGHtests/sentence_transformer/test_compute_embeddings.py0predict() must run the forward pass via __call__ so that model.compile() applies to inference.STRING
HIGHtests/multi_vector_encoder/test_model.py0predict() must run the forward pass via __call__ so that model.compile() applies to inference.STRING
HIGHtests/sparse_encoder/test_model.py0predict() must run the forward pass via __call__ so that model.compile() applies to inference.STRING
HIGHtests/cross_encoder/test_model.py0predict() must run the forward pass via __call__ so that model.compile() applies to inference.STRING
HIGH…ransformer/evaluation/test_label_accuracy_evaluator.py0tests the correct computation of evaluation scores from binaryclassificationevaluatorSTRING
HIGH…mer/evaluation/test_binary_classification_evaluator.py0tests the correct computation of evaluation scores from binaryclassificationevaluatorSTRING
HIGH…sformer/evaluation/test_paraphrase_mining_evaluator.py0tests the correct computation of evaluation scores from binaryclassificationevaluatorSTRING
HIGHtests/base/modules/transformer/test_text_generation.py0create a transformer instance and return it with its supported modalities.STRING
HIGHtests/base/modules/transformer/test_fill_mask.py0create a transformer instance and return it with its supported modalities.STRING
HIGHtests/base/modules/transformer/test_any_to_any.py0create a transformer instance and return it with its supported modalities.STRING
HIGH…se/modules/transformer/test_sequence_classification.py0create a transformer instance and return it with its supported modalities.STRING
HIGHtests/base/modules/transformer/test_text_generation.py0test inference with each supported modality (single and multi-modal).STRING
HIGH…ts/base/modules/transformer/test_feature_extraction.py0test inference with each supported modality (single and multi-modal).STRING
HIGHtests/base/modules/transformer/test_any_to_any.py0test inference with each supported modality (single and multi-modal).STRING
55 more matches not shown…
Self-Referential Comments94 hits · 285 pts
SeverityFileLineSnippetContext
MEDIUMsentence_transformers/sentence_transformer/model.py1151 # Create a pool if not provided, but a list of devices isCOMMENT
MEDIUM…transformers/sentence_transformer/losses/gist_embed.py195 # Define the anchor thresholdCOMMENT
MEDIUM…rmers/sentence_transformer/losses/cached_gist_embed.py298 # Define the anchor thresholdCOMMENT
MEDIUM…s/sentence_transformer/evaluation/paraphrase_mining.py66 # Create a mapping from qid to question & a list of duplicates (qid1, qid2)STRING
MEDIUMsentence_transformers/util/retrieval.py163 """This function is deprecated. Use semantic_search instead"""STRING
MEDIUMsentence_transformers/cross_encoder/model.py301 # Create a pool if is not provided, but a list of devices isCOMMENT
MEDIUM…ers/cross_encoder/losses/multiple_negatives_ranking.py137 # Create a mask for each anchor to each candidate index, where the matching positiveCOMMENT
MEDIUMsentence_transformers/cross_encoder/losses/plist_mle.py224 # Create a mask for valid entriesCOMMENT
MEDIUM…ransformers/cross_encoder/evaluation/classification.py51 # Create a list of pairs, and map the labels to the labels that the model knowsSTRING
MEDIUMsentence_transformers/sparse_encoder/model.py957 # Create a pool if not provided, but a list of devices isCOMMENT
MEDIUMsentence_transformers/base/sampler.py567 # Create a random numpy permutation using int32 (or int64 if necessary)COMMENT
MEDIUMsentence_transformers/base/modules/transformer.py2778 # This method is only called if this model has a modules.json, i.e. it's already been savedCOMMENT
MEDIUMsentence_transformers/base/modules/router.py86 # Create an asymmetric model with different encoders for queries and documentsCOMMENT
MEDIUMtests/sentence_transformer/test_model.py1217 # Create a simple dataset with a text columnCOMMENT
MEDIUMtests/sentence_transformer/test_model.py1338 # Create a Router with mixed modulesCOMMENT
MEDIUMtests/sentence_transformer/test_model.py1002 # Create a mock model with required promptsCOMMENT
MEDIUMtests/sentence_transformer/test_model.py1059 # Create a mock model with required promptsCOMMENT
MEDIUMtests/sentence_transformer/test_multi_process.py89 # Create a poolCOMMENT
MEDIUMtests/sentence_transformer/test_multi_process.py186 # Create a poolCOMMENT
MEDIUMtests/sentence_transformer/test_trainer.py200 # Create a new model card if a Trainer was initializedCOMMENT
MEDIUMtests/sentence_transformer/test_trainer.py833 # Define a custom batch sampler functionCOMMENT
MEDIUMtests/sentence_transformer/test_trainer.py963 # Define a custom multi-dataset batch sampler functionCOMMENT
MEDIUMtests/util/test_hard_negatives.py1308 # Create a larger dataset with 32 entriesCOMMENT
MEDIUMtests/util/test_hard_negatives.py1423 # Create a dataset with just 2 pairsCOMMENT
MEDIUMtests/cross_encoder/test_model.py802 # Create a simple dataset with a text columnCOMMENT
MEDIUMtests/cross_encoder/test_trainer.py101 # Create a new model card if a Trainer was initializedCOMMENT
MEDIUMtests/sparse_encoder/test_model.py426 # Create a simple dataset with a text columnCOMMENT
MEDIUMtests/sparse_encoder/test_model.py136 # Create an empty sparse tensorCOMMENT
MEDIUMtests/sparse_encoder/test_model.py171 # Create a batch where the first sample has values but the second is all zerosCOMMENT
MEDIUMtests/sparse_encoder/test_multi_process.py62 # Create a poolCOMMENT
MEDIUMtests/sparse_encoder/modules/test_csr.py11# Create a wrapper to measure outputs of the forward methodCOMMENT
MEDIUMtests/sparse_encoder/modules/test_csr.py61 # Create the wrapper and replace the forward methodCOMMENT
MEDIUMtests/base/samplers/test_no_duplicates_batch_sampler.py52 # Create a list of two 0's, two 1's, two 2's, ... two 49's. Then shuffle.COMMENT
MEDIUMtests/base/modules/test_router.py733 # Create a Router with different module configurations for each routeCOMMENT
MEDIUMtests/base/modules/test_router.py743 # Create a SentenceTransformer with static_embedding followed by routerCOMMENT
MEDIUMtests/base/modules/test_router.py95# Create a custom ModuleDict subclass to track accessCOMMENT
MEDIUMtests/base/modules/test_router.py237 # Create a Router with StaticEmbedding modulesCOMMENT
MEDIUMtests/base/modules/test_router.py363 # Create a Router with StaticEmbedding modulesCOMMENT
MEDIUMtests/base/modules/test_router.py489 # Create a Router with StaticEmbedding modulesCOMMENT
MEDIUMtests/base/modules/test_router.py507 # Create a loss function that works with routerCOMMENT
MEDIUMtests/base/modules/test_router.py531 # Create a Router with StaticEmbedding modulesCOMMENT
MEDIUMtests/base/modules/test_router.py543 # Create a loss function that works with routerCOMMENT
MEDIUMtests/base/modules/test_router.py1407 # Create an object that will fail modality inferenceCOMMENT
MEDIUMtests/base/modules/test_dense.py92 # Create a Dense layer with custom keysCOMMENT
MEDIUM…raining/data_augmentation/train_sts_qqp_crossdomain.py182# Define the training argumentsCOMMENT
MEDIUM…/training/data_augmentation/train_sts_indomain_bm25.py216# Define the training argumentsCOMMENT
MEDIUM…/training/data_augmentation/train_sts_indomain_bm25.py237# Create the trainer & start trainingCOMMENT
MEDIUM…raining/data_augmentation/train_sts_indomain_nlpaug.py137# Define the training argumentsCOMMENT
MEDIUM…raining/data_augmentation/train_sts_indomain_nlpaug.py158# Create the trainer & start trainingCOMMENT
MEDIUM…ining/data_augmentation/train_sts_indomain_semantic.py226# Define the training argumentsCOMMENT
MEDIUM…transformer/training/other/training_batch_hard_trec.py45 # Create a dev set from train setCOMMENT
MEDIUM…ansformer/training/other/training_gooaq_infonce_gor.py42# Define a custom loss that combines InfoNCE and Global Orthogonal RegularizationCOMMENT
MEDIUM…ransformer/training/distillation/model_distillation.py111# Create a relatively small dataset for evaluationCOMMENT
MEDIUM…ransformer/training/distillation/model_distillation.py116# Create an STSB evaluatorCOMMENT
MEDIUM…ransformer/training/distillation/model_distillation.py165# Define the training argumentsCOMMENT
MEDIUM…ransformer/training/distillation/model_distillation.py189# Create the trainer & start trainingCOMMENT
MEDIUM…ing/distillation/model_distillation_layer_reduction.py58# Create a smaller student model by using only some of the teacher layersCOMMENT
MEDIUM…ing/distillation/model_distillation_layer_reduction.py134# Create a relatively small dataset for evaluationCOMMENT
MEDIUM…ing/distillation/model_distillation_layer_reduction.py169# Create an STSB evaluatorCOMMENT
MEDIUM…ing/distillation/model_distillation_layer_reduction.py188# Define the training argumentsCOMMENT
34 more matches not shown…
Excessive Try-Catch Wrapping194 hits · 195 pts
SeverityFileLineSnippetContext
LOW…entence_transformer/deprecated_model_card_templates.py189 except Exception as e:CODE
MEDIUM…entence_transformer/deprecated_model_card_templates.py160def get_train_objective_info(dataloader, loss):CODE
LOW…nsformers/sentence_transformer/evaluation/nano_beir.py477 except Exception as e:CODE
LOWsentence_transformers/util/hard_negatives.py515 except Exception:CODE
LOWsentence_transformers/util/logging.py19 except Exception:CODE
MEDIUMsentence_transformers/util/logging.py12def emit(self, record) -> None:CODE
LOWsentence_transformers/util/misc.py148 except Exception:CODE
LOWsentence_transformers/util/environment.py192 except Exception as e:CODE
LOWsentence_transformers/util/file_io.py192 except Exception as first_error:CODE
LOWsentence_transformers/util/file_io.py249 except Exception:CODE
LOWsentence_transformers/multi_vector_encoder/model.py1648 except Exception as e:CODE
LOWsentence_transformers/multi_vector_encoder/model.py1652 except Exception:CODE
LOWsentence_transformers/cross_encoder/model.py387 except Exception as e:CODE
LOWsentence_transformers/cross_encoder/model.py391 except Exception:CODE
LOW…nce_transformers/cross_encoder/evaluation/nano_beir.py398 except Exception as e:CODE
LOWsentence_transformers/sparse_encoder/model.py1022 except Exception as e:CODE
LOWsentence_transformers/sparse_encoder/model.py1026 except Exception:CODE
LOWsentence_transformers/base/model.py842 except Exception:CODE
LOWsentence_transformers/base/model.py1008 except Exception as exc:CODE
LOWsentence_transformers/base/model.py1184 except Exception as exc:CODE
LOWsentence_transformers/base/model.py1194 except Exception:CODE
LOWsentence_transformers/base/modality.py457 except Exception as exc:CODE
LOWsentence_transformers/base/trainer.py695 except Exception:CODE
LOWsentence_transformers/base/trainer.py700 except Exception as exc:CODE
LOWsentence_transformers/base/sampler.py373 except Exception:CODE
MEDIUMsentence_transformers/base/model_card.py1445def try_to_float(metric_value):CODE
LOWsentence_transformers/base/model_card.py1339 except Exception:CODE
LOWsentence_transformers/base/model_card.py1963 except Exception as exc:CODE
LOWsentence_transformers/base/model_card.py1971 except Exception as exc:CODE
LOWsentence_transformers/base/model_card.py1979 except Exception as exc:CODE
LOWsentence_transformers/base/model_card.py1986 except Exception as exc:CODE
LOWsentence_transformers/base/model_card.py456 except Exception:CODE
LOWsentence_transformers/base/model_card.py869 except Exception:CODE
LOWsentence_transformers/base/model_card.py912 except Exception:CODE
LOWsentence_transformers/base/model_card.py1408 except Exception:CODE
LOWsentence_transformers/base/model_card.py1448 except Exception:CODE
LOWsentence_transformers/base/model_card.py1578 except Exception:CODE
LOWsentence_transformers/base/model_card.py1586 except Exception:CODE
LOWsentence_transformers/base/model_card.py1608 except Exception:CODE
LOWsentence_transformers/base/model_card.py1863 except Exception:CODE
LOWsentence_transformers/base/model_card.py1920 except Exception:CODE
LOWsentence_transformers/base/model_card.py1931 except Exception as exc:CODE
LOWsentence_transformers/base/model_card.py1937 except Exception as exc:CODE
LOWsentence_transformers/base/model_card.py1948 except Exception as exc:CODE
LOWsentence_transformers/base/model_card.py495 except Exception:STRING
LOWsentence_transformers/base/model_card.py545 except Exception:STRING
LOWsentence_transformers/base/modules/transformer.py2102 except Exception as exc:CODE
LOWsentence_transformers/base/modules/transformer.py2140 except Exception as exc: # never let suffix derivation break tokenizationCODE
LOWsentence_transformers/base/modules/transformer.py2569 except Exception:CODE
LOWtests/cross_encoder/test_model_card.py290 except Exception:CODE
LOWtests/sparse_encoder/test_pretrained.py152 except Exception as e:CODE
LOWtests/sparse_encoder/test_pretrained.py163 except Exception as e:CODE
LOWtests/sparse_encoder/test_pretrained.py193 except Exception as e:CODE
LOWtests/sparse_encoder/test_trainer.py127 except Exception as e:CODE
LOWtests/base/test_model_card.py356 except Exception:CODE
LOWtests/base/test_modality.py821 except Exception as exc:CODE
LOWtests/base/modules/transformer/test_text_generation.py87 except Exception as e:CODE
LOWtests/base/modules/transformer/conftest.py197 except Exception as e:CODE
LOWtests/base/modules/transformer/conftest.py722 except Exception:CODE
LOWtests/base/modules/transformer/test_fill_mask.py78 except Exception as e:CODE
134 more matches not shown…
Modern Structural Boilerplate120 hits · 118 pts
SeverityFileLineSnippetContext
LOWsentence_transformers/__init__.py57__all__ = [CODE
LOWsentence_transformers/sentence_transformer/__init__.py9__all__ = [CODE
LOW…nce_transformers/sentence_transformer/training_args.py53__all__ = ["SentenceTransformerTrainingArguments", "BatchSamplers", "MultiDatasetBatchSamplers"]STRING
LOWsentence_transformers/sentence_transformer/model.py1221 def set_pooling_include_prompt(self, include_prompt: bool) -> None:CODE
LOWsentence_transformers/sentence_transformer/trainer.py33logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/sentence_transformer/fit_mixin.py32logger = logging.getLogger(__name__)CODE
LOW…tence_transformer/losses/multiple_negatives_ranking.py14logger = logging.getLogger(__name__)CODE
LOW…e_transformers/sentence_transformer/losses/__init__.py38__all__ = [CODE
LOW…transformers/sentence_transformer/losses/matryoshka.py15logger = logging.getLogger(__name__)CODE
LOW…transformers/sentence_transformer/losses/matryoshka.py46 def set_dim(self, dim) -> None:CODE
LOW…/sentence_transformer/losses/denoising_auto_encoder.py13logger = logging.getLogger(__name__)CODE
LOW…sformers/sentence_transformer/losses/adaptive_layer.py33 def set_layer_idx(self, layer_idx) -> None:CODE
LOW…ce_transformers/sentence_transformer/losses/softmax.py16logger = logging.getLogger(__name__)CODE
LOW…transformers/sentence_transformer/datasets/__init__.py17__all__ = [CODE
LOW…ormers/sentence_transformer/datasets/sentence_label.py20logger = logging.getLogger(__name__)CODE
LOW…rs/sentence_transformer/datasets/parallel_sentences.py22logger = logging.getLogger(__name__)CODE
LOW…ce_transformers/sentence_transformer/evaluation/mse.py15logger = logging.getLogger(__name__)CODE
LOW…ntence_transformer/evaluation/information_retrieval.py21logger = logging.getLogger(__name__)CODE
LOW…/sentence_transformer/evaluation/mse_from_dataframe.py17logger = logging.getLogger(__name__)CODE
LOW…ansformers/sentence_transformer/evaluation/__init__.py20__all__ = [CODE
LOW…ntence_transformer/evaluation/binary_classification.py24logger = logging.getLogger(__name__)CODE
LOW…nsformers/sentence_transformer/evaluation/reranking.py24logger = logging.getLogger(__name__)CODE
LOW…formers/sentence_transformer/evaluation/translation.py19logger = logging.getLogger(__name__)CODE
LOW…ransformers/sentence_transformer/evaluation/triplet.py25logger = logging.getLogger(__name__)CODE
LOW…s/sentence_transformer/evaluation/paraphrase_mining.py15logger = logging.getLogger(__name__)CODE
LOW…mers/sentence_transformer/evaluation/label_accuracy.py17logger = logging.getLogger(__name__)CODE
LOW…nsformers/sentence_transformer/evaluation/nano_beir.py22logger = logging.getLogger(__name__)CODE
LOW…entence_transformer/evaluation/embedding_similarity.py24logger = logging.getLogger(__name__)CODE
LOW…_transformers/sentence_transformer/readers/__init__.py18__all__ = [CODE
LOW…_transformers/sentence_transformer/modules/__init__.py23__all__ = [CODE
LOW…ransformers/sentence_transformer/modules/clip_model.py8logger = logging.getLogger(__name__)CODE
LOW…tence_transformers/sentence_transformer/modules/bow.py13logger = logging.getLogger(__name__)CODE
LOW…ormers/sentence_transformer/modules/word_embeddings.py24logger = logging.getLogger(__name__)CODE
LOW…rmers/sentence_transformer/modules/static_embedding.py25logger = logging.getLogger(__name__)CODE
LOW…nsformers/sentence_transformer/modules/word_weights.py10logger = logging.getLogger(__name__)CODE
LOW…ers/sentence_transformer/modules/tokenizer/__init__.py7__all__ = [CODE
LOW…rmers/sentence_transformer/modules/tokenizer/phrase.py14logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/util/hard_negatives.py16logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/util/misc.py17logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/util/quantization.py10logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/util/__init__.py69__all__ = [CODE
LOWsentence_transformers/util/retrieval.py17logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/util/environment.py18logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/util/file_io.py11logger = logging.getLogger(__name__)CODE
LOW…_transformers/multi_vector_encoder/interpretability.py275__all__ = [CODE
LOWsentence_transformers/multi_vector_encoder/__init__.py11__all__ = [CODE
LOWsentence_transformers/multi_vector_encoder/trainer.py33logger = logging.getLogger(__name__)CODE
LOW…ntence_transformers/multi_vector_encoder/model_card.py16logger = logging.getLogger(__name__)CODE
LOW…e_transformers/multi_vector_encoder/losses/__init__.py8__all__ = [CODE
LOW…_transformers/multi_vector_encoder/scoring/__init__.py13__all__ = [CODE
LOW…ansformers/multi_vector_encoder/evaluation/__init__.py9__all__ = [CODE
LOW…ormers/multi_vector_encoder/evaluation/distillation.py21logger = logging.getLogger(__name__)CODE
LOW…_transformers/multi_vector_encoder/modules/__init__.py6__all__ = [CODE
LOWsentence_transformers/backend/optimize.py8logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/backend/quantize.py9logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/backend/__init__.py8__all__ = [CODE
LOWsentence_transformers/backend/utils.py18logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/backend/load.py11logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/cross_encoder/__init__.py9__all__ = [CODE
LOWsentence_transformers/cross_encoder/trainer.py31logger = logging.getLogger(__name__)CODE
60 more matches not shown…
AI Structural Patterns117 hits · 100 pts
SeverityFileLineSnippetContext
LOWsentence_transformers/sentence_transformer/model.py155CODE
LOWsentence_transformers/sentence_transformer/model.py228CODE
LOWsentence_transformers/sentence_transformer/model.py248CODE
LOWsentence_transformers/sentence_transformer/model.py269CODE
LOWsentence_transformers/sentence_transformer/model.py290CODE
LOWsentence_transformers/sentence_transformer/model.py312CODE
LOWsentence_transformers/sentence_transformer/model.py332CODE
LOWsentence_transformers/sentence_transformer/model.py391CODE
LOWsentence_transformers/sentence_transformer/model.py411CODE
LOWsentence_transformers/sentence_transformer/model.py432CODE
LOWsentence_transformers/sentence_transformer/model.py453CODE
LOWsentence_transformers/sentence_transformer/model.py475CODE
LOWsentence_transformers/sentence_transformer/model.py495CODE
LOWsentence_transformers/sentence_transformer/model.py565CODE
LOWsentence_transformers/sentence_transformer/model.py585CODE
LOWsentence_transformers/sentence_transformer/model.py606CODE
LOWsentence_transformers/sentence_transformer/model.py627CODE
LOWsentence_transformers/sentence_transformer/model.py648CODE
LOWsentence_transformers/sentence_transformer/model.py669CODE
LOWsentence_transformers/sentence_transformer/model.py690CODE
LOWsentence_transformers/sentence_transformer/model.py711CODE
LOWsentence_transformers/sentence_transformer/model.py733CODE
LOWsentence_transformers/sentence_transformer/model.py754CODE
LOWsentence_transformers/sentence_transformer/model.py1099CODE
LOWsentence_transformers/sentence_transformer/trainer.py118CODE
LOWsentence_transformers/sentence_transformer/fit_mixin.py160CODE
LOWsentence_transformers/sentence_transformer/fit_mixin.py456CODE
LOW…ransformer/losses/cached_multiple_negatives_ranking.py27CODE
LOW…nsformers/sentence_transformer/losses/matryoshka_2d.py15CODE
LOW…rmers/sentence_transformer/losses/cached_gist_embed.py32CODE
LOW…ntence_transformer/evaluation/information_retrieval.py131CODE
LOW…nsformers/sentence_transformer/evaluation/reranking.py91CODE
LOW…ransformers/sentence_transformer/evaluation/triplet.py93CODE
LOW…s/sentence_transformer/evaluation/paraphrase_mining.py92CODE
LOW…nsformers/sentence_transformer/evaluation/nano_beir.py214CODE
LOW…entence_transformer/evaluation/embedding_similarity.py82CODE
LOW…_transformers/sentence_transformer/readers/sts_data.py26CODE
LOW…_transformers/sentence_transformer/readers/sts_data.py78CODE
LOW…ormers/sentence_transformer/modules/word_embeddings.py91CODE
LOW…rmers/sentence_transformer/modules/static_embedding.py169CODE
LOWsentence_transformers/util/hard_negatives.py25CODE
LOWsentence_transformers/util/quantization.py18CODE
LOWsentence_transformers/util/quantization.py202CODE
LOWsentence_transformers/util/retrieval.py23CODE
LOWsentence_transformers/multi_vector_encoder/model.py157CODE
LOWsentence_transformers/multi_vector_encoder/model.py225CODE
LOWsentence_transformers/multi_vector_encoder/model.py243CODE
LOWsentence_transformers/multi_vector_encoder/model.py262CODE
LOWsentence_transformers/multi_vector_encoder/model.py281CODE
LOWsentence_transformers/multi_vector_encoder/model.py299CODE
LOWsentence_transformers/multi_vector_encoder/model.py318CODE
LOWsentence_transformers/multi_vector_encoder/model.py338CODE
LOWsentence_transformers/multi_vector_encoder/model.py355CODE
LOWsentence_transformers/multi_vector_encoder/model.py401CODE
LOWsentence_transformers/multi_vector_encoder/model.py419CODE
LOWsentence_transformers/multi_vector_encoder/model.py438CODE
LOWsentence_transformers/multi_vector_encoder/model.py457CODE
LOWsentence_transformers/multi_vector_encoder/model.py475CODE
LOWsentence_transformers/multi_vector_encoder/model.py494CODE
LOWsentence_transformers/multi_vector_encoder/model.py514CODE
57 more matches not shown…
Docstring Block Structure20 hits · 100 pts
SeverityFileLineSnippetContext
HIGHsentence_transformers/sentence_transformer/trainer.py37 SentenceTransformerTrainer is a simple but feature-complete training and eval loop for PyTorch based on the 🤗 TSTRING
HIGH…rmers/sentence_transformer/modules/static_embedding.py182 Creates a StaticEmbedding instance from a distillation process using the `model2vec` package. Args: STRING
HIGH…rmers/sentence_transformer/modules/static_embedding.py245 Create a StaticEmbedding instance from a model2vec model. This method loads a pre-trained model2vec model STRING
HIGHsentence_transformers/util/misc.py120 Import a dotted module path and return the attribute/class designated by the last name in the path. Raise ImporSTRING
HIGHsentence_transformers/util/misc.py169 Resolve a module class reference to a class object. For class refs in the ``sentence_transformers.*`` namespacSTRING
HIGHsentence_transformers/util/similarity.py840 Converts a similarity function name or enum value to the corresponding similarity function. Args: STRING
HIGHsentence_transformers/util/similarity.py882 Converts a similarity function into a pairwise similarity function. The pairwise similarity function rSTRING
HIGHsentence_transformers/util/quantization.py31 Performs semantic search using the FAISS library. Rescoring will be performed if: 1. `rescore` is True STRING
HIGHsentence_transformers/util/quantization.py215 Performs semantic search using the usearch library. Rescoring will be performed if: 1. `rescore` is True STRING
HIGHsentence_transformers/util/tensor.py195 Returns a new tensor with only the top-k values (in absolute terms) of each embedding, all others set to zero. STRING
HIGHsentence_transformers/util/file_io.py41 Checks if the given model name or path corresponds to a SentenceTransformer model. Args: model_name_orSTRING
HIGHsentence_transformers/util/file_io.py82 Loads a file from a local or remote location. Args: model_name_or_path (str): The model name or path. STRING
HIGHsentence_transformers/util/file_io.py141 Loads the subfolder path for a given model name or path. Args: model_name_or_path (str): The name or pSTRING
HIGHsentence_transformers/util/file_io.py206Download a URL to a local file with a progress bar. The content is streamed in chunks and first written to a temporSTRING
HIGHsentence_transformers/backend/optimize.py27 Export an optimized ONNX model from a SentenceTransformer, SparseEncoder, CrossEncoder, or MultiVectorEncoder mSTRING
HIGHsentence_transformers/backend/quantize.py32 Export a quantized ONNX model from a SentenceTransformer, SparseEncoder, CrossEncoder, or MultiVectorEncoder moSTRING
HIGHsentence_transformers/backend/quantize.py121 Export a quantized OpenVINO model from a SentenceTransformer, SparseEncoder, CrossEncoder, or MultiVectorEncodeSTRING
HIGHsentence_transformers/cross_encoder/model.py584 Performs predictions with the CrossEncoder on the given input pairs. .. tip:: Adjusting `STRING
HIGHsentence_transformers/base/modality.py693Infer the modality of a single input sample by inspecting its type/structure. Pure type-based detection, does not rSTRING
HIGHsentence_transformers/base/modules/module.py321 A utility function to load the PyTorch weights of a model from a checkpoint. The checkpoint can be either a STRING
Deep Nesting98 hits · 85 pts
SeverityFileLineSnippetContext
LOWsentence_transformers/sentence_transformer/model.py754CODE
LOWsentence_transformers/sentence_transformer/model.py1133CODE
LOWsentence_transformers/sentence_transformer/model.py1198CODE
LOWsentence_transformers/sentence_transformer/fit_mixin.py62CODE
LOWsentence_transformers/sentence_transformer/fit_mixin.py398CODE
LOWsentence_transformers/sentence_transformer/fit_mixin.py456CODE
LOW…tence_transformer/losses/multiple_negatives_ranking.py237CODE
LOW…ransformer/losses/cached_multiple_negatives_ranking.py244CODE
LOW…transformers/sentence_transformer/losses/matryoshka.py88CODE
LOW…sformers/sentence_transformer/losses/adaptive_layer.py213CODE
LOW…rmers/sentence_transformer/losses/cached_gist_embed.py181CODE
LOW…tence_transformer/datasets/no_duplicates_dataloader.py29CODE
LOW…ntence_transformer/evaluation/information_retrieval.py308CODE
LOW…ntence_transformer/evaluation/information_retrieval.py477CODE
LOW…formers/sentence_transformer/evaluation/translation.py102CODE
LOW…ransformers/sentence_transformer/evaluation/triplet.py93CODE
LOW…s/sentence_transformer/evaluation/paraphrase_mining.py245CODE
LOW…e_transformers/sentence_transformer/modules/pooling.py171CODE
LOW…e_transformers/sentence_transformer/modules/pooling.py245CODE
LOW…rmers/sentence_transformer/modules/tokenizer/phrase.py63CODE
LOWsentence_transformers/util/hard_negatives.py25CODE
LOWsentence_transformers/util/deprecated_import.py212CODE
LOWsentence_transformers/util/quantization.py18CODE
LOWsentence_transformers/util/quantization.py202CODE
LOWsentence_transformers/util/quantization.py390CODE
LOWsentence_transformers/util/dataset.py159CODE
LOWsentence_transformers/util/retrieval.py89CODE
LOWsentence_transformers/util/retrieval.py167CODE
LOWsentence_transformers/util/retrieval.py258CODE
LOWsentence_transformers/util/environment.py56CODE
LOWsentence_transformers/util/file_io.py205CODE
LOWsentence_transformers/util/decorators.py97CODE
LOWsentence_transformers/util/decorators.py120CODE
LOWsentence_transformers/multi_vector_encoder/model.py718CODE
LOWsentence_transformers/backend/utils.py155CODE
LOWsentence_transformers/cross_encoder/model.py283CODE
LOWsentence_transformers/cross_encoder/model.py357CODE
LOWsentence_transformers/cross_encoder/fit_mixin.py59CODE
LOWsentence_transformers/cross_encoder/fit_mixin.py407CODE
LOWsentence_transformers/sparse_encoder/model.py940CODE
LOW…rs/sparse_encoder/evaluation/reciprocal_rank_fusion.py105CODE
LOW…_transformers/sparse_encoder/modules/splade_pooling.py66CODE
LOWsentence_transformers/base/model.py918CODE
LOWsentence_transformers/base/model.py1116CODE
LOWsentence_transformers/base/modality.py313CODE
LOWsentence_transformers/base/modality.py583CODE
LOWsentence_transformers/base/modality.py607CODE
LOWsentence_transformers/base/data_collator.py150CODE
LOWsentence_transformers/base/trainer.py399CODE
LOWsentence_transformers/base/trainer.py424CODE
LOWsentence_transformers/base/trainer.py543CODE
LOWsentence_transformers/base/trainer.py825CODE
LOWsentence_transformers/base/trainer.py1242CODE
LOWsentence_transformers/base/model_card.py429CODE
LOWsentence_transformers/base/model_card.py512CODE
LOWsentence_transformers/base/model_card.py614CODE
LOWsentence_transformers/base/model_card.py716CODE
LOWsentence_transformers/base/model_card.py810CODE
LOWsentence_transformers/base/model_card.py1382CODE
LOWsentence_transformers/base/model_card.py1915CODE
38 more matches not shown…
Modern AI Meta-Vocabulary22 hits · 60 pts
SeverityFileLineSnippetContext
MEDIUMsentence_transformers/base/modules/router.py77 # Use a regular SentenceTransformer for the document embeddings, and a static embedding model for the quCOMMENT
MEDIUMdocs/migration_guide.md572 # and a static embedding model for the query embeddingsCOMMENT
MEDIUMdocs/migration_guide.md599 # and a static embedding model for the query embeddingsCOMMENT
MEDIUMdocs/cross_encoder/training_overview.md323 # Mine hard negatives using a very efficient embedding modelCOMMENT
MEDIUMdocs/cross_encoder/training_overview.md335 batch_size=4096, # Use a batch size of 4096 for the embedding modelCODE
MEDIUMdocs/cross_encoder/training_overview.md607 # Mine hard negatives using a very efficient embedding modelCOMMENT
MEDIUMdocs/cross_encoder/training_overview.md614 batch_size=4096, # Use a batch size of 4096 for the embedding modelCODE
MEDIUMdocs/cross_encoder/training_overview.md955 # 2b. Modify our training dataset to include hard negatives using a very efficient embedding modelCOMMENT
MEDIUMdocs/cross_encoder/training_overview.md965 batch_size=4096, # Use a batch size of 4096 for the embedding modelCODE
MEDIUMdocs/cross_encoder/training_overview.md988 # embedding model as a baseline.COMMENT
MEDIUM…nsformer/applications/embedding-quantization/README.md37# 1. Load an embedding modelCOMMENT
MEDIUM…nsformer/applications/embedding-quantization/README.md109# 1. Load an embedding modelCOMMENT
MEDIUM…rmer/applications/parallel-sentence-mining/bucc2018.py62# Use PCA to reduce the dimensionality of the sentence embedding modelCOMMENT
MEDIUM…cross_encoder/training/rerankers/training_gooaq_bce.py54 # 2b. Modify our training dataset to include hard negatives using a very efficient embedding modelCOMMENT
MEDIUM…cross_encoder/training/rerankers/training_gooaq_bce.py64 batch_size=4096, # Use a batch size of 4096 for the embedding modelCODE
MEDIUM…cross_encoder/training/rerankers/training_gooaq_bce.py87 # embedding model as a baseline.COMMENT
MEDIUM…ss_encoder/training/rerankers/training_gooaq_lambda.py54 # 2b. Modify our training dataset to include hard negatives using a very efficient embedding modelCOMMENT
MEDIUM…ss_encoder/training/rerankers/training_gooaq_lambda.py64 batch_size=4096, # Use a batch size of 4096 for the embedding modelCODE
MEDIUM…ss_encoder/training/rerankers/training_gooaq_lambda.py86 # embedding model as a baseline.COMMENT
MEDIUM…es/cross_encoder/training/rerankers/training_nq_bce.py54 # 2b. Modify our training dataset to include hard negatives using a very efficient embedding modelCOMMENT
MEDIUM…es/cross_encoder/training/rerankers/training_nq_bce.py64 batch_size=4096, # Use a batch size of 4096 for the embedding modelCODE
MEDIUM…es/cross_encoder/training/rerankers/training_nq_bce.py87 # embedding model as a baseline.COMMENT
Redundant / Tautological Comments42 hits · 55 pts
SeverityFileLineSnippetContext
LOW…mers/sentence_transformer/losses/batch_hard_triplet.py243 # Check if labels[i] == labels[j]COMMENT
LOW…mers/sentence_transformer/losses/batch_hard_triplet.py257 # Check if labels[i] != labels[k]COMMENT
LOWsentence_transformers/util/tensor.py40 # Check if list contains sparse tensorsCOMMENT
LOWsentence_transformers/util/retrieval.py332 # Check if we need to increase sort_max_sizeCOMMENT
LOWsentence_transformers/cross_encoder/model_card.py211 # Check if any pair element is non-text (from usage_examples before asset saving)COMMENT
LOW…arse_encoder/evaluation/sparse_embedding_similarity.py78 # Print the resultsSTRING
LOW…rse_encoder/evaluation/sparse_information_retrieval.py128 # Print the resultsSTRING
LOW…ansformers/sparse_encoder/evaluation/sparse_triplet.py90 # Print the resultsSTRING
LOW…sformers/sparse_encoder/evaluation/sparse_nano_beir.py171 # Print the resultsSTRING
LOW…rse_encoder/evaluation/sparse_binary_classification.py104 # Print the resultsSTRING
LOW…e_transformers/sparse_encoder/evaluation/sparse_mse.py78 # Print the resultsSTRING
LOW…ormers/sparse_encoder/evaluation/sparse_translation.py75 # Print the resultsSTRING
LOW…sformers/sparse_encoder/evaluation/sparse_reranking.py102 # Print the resultsSTRING
LOW…mers/sparse_encoder/modules/sparse_static_embedding.py202 # Check if we have a JSON path in configCOMMENT
LOWsentence_transformers/base/model.py1059 # Check if this is a Sentence Transformer modelCOMMENT
LOWsentence_transformers/base/model.py1145 # Check if the config_sentence_transformers.json file exists (exists since v2 of the framework)COMMENT
LOWsentence_transformers/base/model.py1173 # Check if a readme exists. README is optional metadata. A transient Hub errorCOMMENT
LOWsentence_transformers/base/model.py1227 # Check if the `load` method only accepts a single parameter (the path to the local directory).COMMENT
LOWsentence_transformers/base/model_card.py671 # Check if the model has a tuple modality whose parts all match available columns.STRING
LOWtests/sparse_encoder/utils.py26 # Check if shape matchesCOMMENT
LOWtests/sparse_encoder/utils.py40 # Check if indices are the sameCOMMENT
LOWtests/sparse_encoder/utils.py44 # Check if values are closeCOMMENT
LOWtests/sparse_encoder/test_trainer.py116 # Check if model parameters have changed after trainingCOMMENT
LOW…sparse_encoder/modules/test_sparse_static_embedding.py55 # Check if embeddings are the same before and after save/loadCOMMENT
LOW…sparse_encoder/modules/test_sparse_static_embedding.py58 # Check if SparseStaticEmbedding weights are maintained after loadingCOMMENT
LOW…modules/transformer/update_transformers_tiny_models.py42 # Check if the model_id contains the architecture nameCOMMENT
LOW…er/training/quora_duplicate_questions/create_splits.py510####### Write files for Information Retrieval #####COMMENT
LOW…/embedding-quantization/semantic_search_recommended.py120 # Output the resultsCOMMENT
LOW…tions/semantic-search/semantic_search_quora_pytorch.py34# Check if embedding cache path existsCOMMENT
LOW…cations/semantic-search/semantic_search_quora_annoy.py55# Check if embedding cache path existsCOMMENT
LOW…tions/semantic-search/semantic_search_quora_hnswlib.py45# Check if embedding cache path existsCOMMENT
LOW…cations/semantic-search/semantic_search_quora_faiss.py59# Check if embedding cache path existsCOMMENT
LOW…/cross_encoder/applications/cross_encoder_reranking.py41# Check if embedding cache path existsCOMMENT
LOW…parse_encoder/evaluation/sparse_reranking_evaluator.py53# Print the resultsCOMMENT
LOW…coder/evaluation/sparse_nanobeir_advanced_evaluator.py45# Print the resultsCOMMENT
LOW…arse_encoder/evaluation/sparse_similarity_evaluator.py31# Print the resultsCOMMENT
LOW…rse_encoder/evaluation/sparse_translation_evaluator.py30# Print the resultsCOMMENT
LOW…/sparse_encoder/evaluation/sparse_triplet_evaluator.py37# Print the resultsCOMMENT
LOW…parse_encoder/evaluation/sparse_retrieval_evaluator.py69# Print the resultsCOMMENT
LOW…sparse_encoder/evaluation/sparse_nanobeir_evaluator.py94# Print the resultsCOMMENT
LOW…_encoder/evaluation/sparse_classification_evaluator.py58# Print the resultsCOMMENT
LOW…ples/sparse_encoder/evaluation/sparse_mse_evaluator.py32# Print the resultsCOMMENT
AI Slop Vocabulary7 hits · 14 pts
SeverityFileLineSnippetContext
LOW…transformers/sentence_transformer/losses/gist_embed.py245 # so the label for anchor[i] is i. This means that we can just use arangeCOMMENT
LOW…rmers/sentence_transformer/losses/cached_gist_embed.py281 # so the label for anchor[i] is i. This means that we can just use arangeCOMMENT
LOWsentence_transformers/base/trainer.py525 # if loss is nan or inf simply add the average of previous logged lossesCOMMENT
LOWsentence_transformers/base/trainer.py578 # would not accept it. If None, we just call the super().log() method without it so that it works with all versiCOMMENT
LOWsentence_transformers/base/trainer.py654 # If the evaluator is not defined, we can just return the outputCOMMENT
MEDIUM…applications/parallel-sentence-mining/bitext_mining.py27# Model we want to use for bitext mining. sentence-transformers/LaBSE achieves state-of-the-art performanceCOMMENT
MEDIUM…rmer/applications/parallel-sentence-mining/bucc2018.py25# Model we want to use for bitext mining. sentence-transformers/LaBSE achieves state-of-the-art performanceCOMMENT
Verbosity Indicators9 hits · 14 pts
SeverityFileLineSnippetContext
LOW…raining/data_augmentation/train_sts_qqp_crossdomain.py102# Step 1: Train cross-encoder model with STSbenchmarkCOMMENT
LOW…raining/data_augmentation/train_sts_qqp_crossdomain.py141# Step 2: Label QQP train dataset using cross-encoder (BERT) modelCOMMENT
LOW…raining/data_augmentation/train_sts_qqp_crossdomain.py158# Step 3: Train bi-encoder (SBERT) model with QQP dataset - Augmented SBERTCOMMENT
LOW…/training/data_augmentation/train_sts_indomain_bm25.py89# Step 1: Train cross-encoder model with (gold) STS benchmark datasetCOMMENT
LOW…/training/data_augmentation/train_sts_indomain_bm25.py135# Step 2: Label BM25 sampled STSb (silver dataset) using cross-encoder modelCOMMENT
LOW…/training/data_augmentation/train_sts_indomain_bm25.py188# Step 3: Train bi-encoder model with both (gold + silver) STSbenchmark dataset - Augmented SBERTCOMMENT
LOW…ining/data_augmentation/train_sts_indomain_semantic.py101# Step 1: Train cross-encoder model with STSbenchmarkCOMMENT
LOW…ining/data_augmentation/train_sts_indomain_semantic.py140# Step 2: Find silver pairs to labelCOMMENT
LOW…ining/data_augmentation/train_sts_indomain_semantic.py199# Step 3: Train bi-encoder model with both STSbenchmark and labeled AllNlI - Augmented SBERTCOMMENT
Structural Annotation Overuse9 hits · 14 pts
SeverityFileLineSnippetContext
LOW…raining/data_augmentation/train_sts_qqp_crossdomain.py102# Step 1: Train cross-encoder model with STSbenchmarkCOMMENT
LOW…raining/data_augmentation/train_sts_qqp_crossdomain.py141# Step 2: Label QQP train dataset using cross-encoder (BERT) modelCOMMENT
LOW…raining/data_augmentation/train_sts_qqp_crossdomain.py158# Step 3: Train bi-encoder (SBERT) model with QQP dataset - Augmented SBERTCOMMENT
LOW…/training/data_augmentation/train_sts_indomain_bm25.py89# Step 1: Train cross-encoder model with (gold) STS benchmark datasetCOMMENT
LOW…/training/data_augmentation/train_sts_indomain_bm25.py135# Step 2: Label BM25 sampled STSb (silver dataset) using cross-encoder modelCOMMENT
LOW…/training/data_augmentation/train_sts_indomain_bm25.py188# Step 3: Train bi-encoder model with both (gold + silver) STSbenchmark dataset - Augmented SBERTCOMMENT
LOW…ining/data_augmentation/train_sts_indomain_semantic.py101# Step 1: Train cross-encoder model with STSbenchmarkCOMMENT
LOW…ining/data_augmentation/train_sts_indomain_semantic.py140# Step 2: Find silver pairs to labelCOMMENT
LOW…ining/data_augmentation/train_sts_indomain_semantic.py199# Step 3: Train bi-encoder model with both STSbenchmark and labeled AllNlI - Augmented SBERTCOMMENT
Over-Commented Block13 hits · 13 pts
SeverityFileLineSnippetContext
LOWdocs/conf.py1# Configuration file for the Sphinx documentation builder.COMMENT
LOWdocs/sparse_encoder/training_overview.md141 router = Router.for_query_document(COMMENT
LOW…raining/data_augmentation/train_sts_qqp_crossdomain.py141# Step 2: Label QQP train dataset using cross-encoder (BERT) modelCOMMENT
LOW…ransformer/training/distillation/model_quantization.py61 },COMMENT
LOW…transformer/training/multilingual/make_multilingual.py81# If we want, we can limit the maximum sequence length for the modelCOMMENT
LOW…ations/embedding-quantization/semantic_search_faiss.py61 # In the first call we'll provide the `corpus_embeddings` and get the `corpus_index` back, whichCOMMENT
LOW…ions/embedding-quantization/semantic_search_usearch.py61 # In the first call we'll provide the `corpus_embeddings` and get the `corpus_index` back, whichCOMMENT
LOW…ples/multi_vector_encoder/compression/token_pooling.py61 # (3) Pipeline module: bake the pooling into the model so every consumer of the savedCOMMENT
LOW…ncoder/training/ms_marco/training_ms_marco_plistmle.py101 # lambda_weight = PListMLELambdaWeight(rank_discount_fn=custom_discount)COMMENT
LOWexamples/cross_encoder/training/distillation/README.md61# {"corpus_id": 4, "score": 0.91639173},COMMENT
LOW.github/workflows/sync-skills.yml1name: Sync skill to huggingface/skillsCOMMENT
LOW…train_sentence_transformer_static_embedding_example.py1#!/usr/bin/env python3COMMENT
LOW…cripts/train_sentence_transformer_with_lora_example.py1#!/usr/bin/env python3COMMENT
Cross-Language Confusion1 hit · 8 pts
SeverityFileLineSnippetContext
HIGH…ormers/multi_vector_encoder/evaluation/distillation.py214 # One document per query: a per-query distribution is undefined, so this softmaxes overCOMMENT
Slop Phrases2 hits · 6 pts
SeverityFileLineSnippetContext
MEDIUM…te_questions/application_duplicate_questions_mining.py10# For demonstration purposes, we limit it to a few questions which all have on duplicateCOMMENT
MEDIUM…ce_transformer/training/prompts/training_nq_prompts.py26# Feel free to adjust these variables:COMMENT
Fake / Example Data1 hit · 2 pts
SeverityFileLineSnippetContext
LOWtests/base/test_model.py382 SentenceTransformer(modules=[torch.nn.Linear(10, 10)], use_auth_token="fake-token")CODE