Repository Analysis

huggingface/sentence-transformers

State-of-the-Art Embeddings, Retrieval, and Reranking

26.2 Moderate AI signal View on GitHub

Analysis Overview

This report presents the forensic synthetic code analysis of huggingface/sentence-transformers, a Python project with 18,907 GitHub stars. SynthScan v2.0 examined 111,868 lines of code across 590 source files, recording 2248 pattern matches distributed across 17 syntactic categories. The overall adjusted score of 26.2 places this repository in the Moderate AI signal band.

The scanner applied 160+ deterministic lexical heuristics, multi-line block detectors, abstract syntax tree depth profilers, and a cross-file Jaccard similarity matrix to construct a statistically normalised synthetic code estimate. All matches are individually weighted by severity coefficient and contextual multiplier before summation, and the resulting headline score is temporally discounted to account for the repository's development history relative to the commercial emergence of large language model coding tooling (November 2022 onward).

26.2
Adjusted Score
26.2
Raw Score
100%
Time Factor
2026-07-13
Last Push
18.9K
Stars
Python
Language
111.9K
Lines of Code
590
Files
2.2K
Pattern Hits
2026-07-14
Scan Date
0.23
HC Hit Rate

What These Metrics Mean

Adjusted Score
Primary synthetic code indicator. Raw score normalised per 1,000 lines of code and multiplied by the temporal discount factor. This is the definitive comparative metric — use it to rank repositories by AI authorship density.
Raw Score
The unmodified sum of all severity-weighted, context-multiplied pattern match scores before temporal discounting. Reflects the absolute signal strength independent of when the repository was last active.
Time Factor
The temporal discount multiplier (0–100%) applied to the raw score. Repositories last updated before ChatGPT's launch (Nov 2022) receive a 5% factor. Full signal is only assigned to repositories active in the post-adoption era (Jan 2024+).
Pattern Hits
Total count of individual pattern matches across all files and categories. A high hit count with a low score may indicate a very large codebase with isolated AI snippets; a low count with a high score indicates dense, concentrated AI signatures.
HC Hit Rate
High+Critical pattern hits per file, averaged across the repository. This orthogonal signal catches repositories where a few files are densely packed with high-severity AI tells — a strong indicator even when the normalised score appears moderate due to codebase size.
Lines of Code / Files
Total lines and files analysed. The scanner examines 94 file extensions. These denominators are used to normalise the score, enabling fair comparison between repositories of vastly different sizes.

Score History

This chart maps the temporal evolution of the adjusted synthetic code score across successive scan runs. An upward trajectory indicates ongoing incorporation of AI-generated code or expanding LLM-assisted scaffolding; a stable or declining trajectory may reflect active human refactoring, code removal, or the adoption of stricter authorship policies. The dashed secondary line (right axis) independently tracks total raw pattern hit count, which can diverge from the normalised score when codebase size changes significantly between scans.

Severity Breakdown

Classifies detected patterns by their diagnostic confidence and structural impact. CRITICAL patterns (coefficient 10) represent definitive synthetic signatures — hallucinated imports, explicit LLM attribution metadata — virtually never produced by human authors. HIGH (5) indicates strong structural tells such as cross-file repetition or cross-linguistic idioms. MEDIUM (2) covers recognisable conversational padding and AI-specific vocabulary. LOW (1) captures subtle indicators like tautological comments and generic boilerplate that require density to carry independent signal.

CRITICAL 0HIGH 133MEDIUM 124LOW 1991

Directory Score Breakdown

This horizontal bar chart decomposes the repository's raw synthetic code score by top-level directory, allowing you to pinpoint precisely which modules or components carry the highest AI authorship density. Directories with disproportionately high scores relative to their size warrant targeted manual review: concentrated AI signatures often trace back to mass-generated configuration layers, auto-ported test suites, LLM-scaffolded boilerplate classes, or entire subsystems authored under heavy copilot assistance. Use this view to prioritise your human code-review effort.

Pattern Findings

The scanner identified 2248 distinct pattern matches across 17 syntactic categories. Each entry below represents a discrete location in the source code where the engine recorded a statistically significant AI authorship indicator. Expand any category row to inspect the individual file paths, line numbers, code snippets, and the lexical context (CODE, COMMENT, or STRING) in which each match was detected.

Reading the findings table: The Severity column indicates the diagnostic confidence level (CRITICAL / HIGH / MEDIUM / LOW). The Context column identifies whether the match occurred inside executable code, an inline comment, or a string literal — comment-context matches receive a ×1.5 weight because LLMs systematically over-annotate. The ⚡ bolt icon marks clustered matches: three or more patterns within a 10-line window, each receiving an additional ×1.5 density multiplier as dense clusters constitute far stronger evidence of synthetic authorship than isolated hits.

Hyper-Verbose Identifiers914 hits · 844 pts
SeverityFileLineSnippetContext
LOW…entence_transformer/deprecated_model_card_templates.py125 def model_card_get_pooling_function(pooling_mode):STRING
LOWsentence_transformers/sentence_transformer/model.py931 def set_pooling_include_prompt(self, include_prompt: bool) -> None:CODE
LOWsentence_transformers/sentence_transformer/model.py977 def get_sentence_embedding_dimension(self) -> int | None:CODE
LOWsentence_transformers/sentence_transformer/model.py1015 def truncate_sentence_embeddings(self, truncate_dim: int | None) -> Iterator[None]:CODE
LOW…ntence_transformers/sentence_transformer/model_card.py129 def get_model_specific_metadata(self) -> dict[str, Any]:CODE
LOW…sentence_transformer/losses/batch_semi_hard_triplet.py110 def batch_semi_hard_triplet_loss(self, labels: Tensor, embeddings: Tensor) -> Tensor:CODE
LOW…tence_transformer/losses/multiple_negatives_ranking.py237 def compute_loss_from_embeddings(self, embeddings: list[Tensor], labels: Tensor) -> Tensor:CODE
LOW…ence_transformers/sentence_transformer/losses/angle.py83 def compute_loss_from_embeddings(CODE
LOW…ransformer/losses/cached_multiple_negatives_ranking.py436 def calculate_loss_and_cache_gradients(self, reps: list[list[Tensor]]) -> Tensor:CODE
LOW…transformer/losses/global_orthogonal_regularization.py139 def compute_loss_from_embeddings(CODE
LOW…mers/sentence_transformer/losses/batch_hard_triplet.py228 def get_anchor_positive_triplet_mask(labels: Tensor) -> Tensor:CODE
LOW…mers/sentence_transformer/losses/batch_hard_triplet.py247 def get_anchor_negative_triplet_mask(labels: Tensor) -> Tensor:CODE
LOW…transformers/sentence_transformer/losses/margin_mse.py177 def compute_loss_from_embeddings(self, embeddings: list[Tensor], labels: Tensor) -> Tensor:CODE
LOW…rmers/sentence_transformer/losses/cosine_similarity.py83 def compute_loss_from_embeddings(self, embeddings: list[Tensor], labels: Tensor) -> Tensor:CODE
LOW…/sentence_transformer/losses/denoising_auto_encoder.py16def _tie_encoder_decoder_weights(encoder: nn.Module, decoder: nn.Module) -> None:CODE
LOW…nce_transformers/sentence_transformer/losses/cosent.py86 def compute_loss_from_embeddings(self, embeddings: list[Tensor], labels: Tensor) -> Tensor:CODE
LOW…ce_transformers/sentence_transformer/losses/triplet.py87 def compute_loss_from_embeddings(self, embeddings: list[Tensor], labels: Tensor) -> Tensor:CODE
LOW…e_transformer/losses/batch_hard_soft_margin_triplet.py99 def batch_hard_triplet_soft_margin_loss(self, labels: Tensor, embeddings: Tensor) -> Tensor:CODE
LOW…sformers/sentence_transformer/losses/distill_kl_div.py141 def compute_loss_from_embeddings(self, embeddings: list[Tensor], labels: Tensor) -> Tensor:CODE
LOW…rmers/sentence_transformer/losses/cached_gist_embed.py296 def calculate_loss_and_cache_gradients(self, reps: list[list[Tensor]], reps_guided: list[list[Tensor]]) -> Tensor:CODE
LOW…nsformers/sentence_transformer/losses/embed_distill.py196 def compute_loss_from_embeddings(self, embeddings: list[Tensor], teacher_embeddings: list[Tensor]) -> Tensor:CODE
LOW…ntence_transformer/evaluation/binary_classification.py316 def find_best_acc_and_threshold(scores, labels, high_score_more_similar: bool):CODE
LOW…nsformers/sentence_transformer/evaluation/reranking.py291 def compute_metrics_individual(self, model: SentenceTransformer):CODE
LOW…nsformers/sentence_transformer/evaluation/nano_beir.py468 def _load_dataset_subset_split(self, subset: str, split: str, required_columns: list[str]):CODE
LOW…nsformers/sentence_transformer/evaluation/nano_beir.py523 def store_metrics_in_model_card_data(self, *args, **kwargs):CODE
LOW…e_transformers/sentence_transformer/modules/pooling.py26def _convert_legacy_pooling_kwargs(kwargs: dict[str, Any]) -> None:CODE
LOW…e_transformers/sentence_transformer/modules/pooling.py46def _deprecated_pooling_mode_kwargs(func):CODE
LOW…e_transformers/sentence_transformer/modules/pooling.py151 def _exclude_prompt_from_mask(attention_mask: Tensor, prompt_length: int) -> Tensor:CODE
LOW…ransformers/sentence_transformer/modules/clip_model.py36 def _get_default_modality_config(config: dict[str, Any]) -> tuple[ModalityConfig, str]:CODE
LOWsentence_transformers/util/deprecated_import.py261def setup_deprecated_module_imports() -> None:CODE
LOWsentence_transformers/util/similarity.py299 def to_similarity_pairwise_fn(CODE
LOWsentence_transformers/util/retrieval.py89def paraphrase_mining_embeddings(CODE
LOWsentence_transformers/util/environment.py28def suggest_extra_on_exception() -> Generator[None, None, None]:CODE
LOWsentence_transformers/util/environment.py83def check_package_availability(package_name: str, owner: str) -> bool:CODE
LOWsentence_transformers/util/file_io.py34def is_sentence_transformer_model(CODE
LOWsentence_transformers/util/decorators.py48def transformer_kwargs_decorator(func):CODE
LOWsentence_transformers/util/decorators.py92def cross_encoder_init_args_decorator(func):CODE
LOWsentence_transformers/util/decorators.py165def cross_encoder_predict_rank_args_decorator(func):CODE
LOWsentence_transformers/util/decorators.py190def save_to_hub_args_decorator(func):CODE
LOWsentence_transformers/backend/optimize.py19def export_optimized_onnx_model(CODE
LOWsentence_transformers/backend/quantize.py24def export_dynamic_quantized_onnx_model(CODE
LOWsentence_transformers/backend/quantize.py107def export_static_quantized_openvino_model(CODE
LOWsentence_transformers/backend/utils.py155def save_or_push_to_hub_model(CODE
LOWsentence_transformers/cross_encoder/model.py406 def get_default_activation_fn(self) -> Callable:CODE
LOWsentence_transformers/cross_encoder/model.py467 def default_activation_function(self) -> Callable:CODE
LOWsentence_transformers/cross_encoder/fit_mixin.py397 def smart_batching_collate_text_only(self, batch: list[InputExample]) -> BatchEncoding:CODE
LOWsentence_transformers/cross_encoder/model_card.py269 def get_model_specific_metadata(self) -> dict[str, Any]:CODE
LOW…ss_encoder/losses/cached_multiple_negatives_ranking.py239 def calculate_loss_and_cache_gradients(self, logits: list[Tensor], batch_size: int) -> Tensor:CODE
LOW…nce_transformers/cross_encoder/evaluation/nano_beir.py389 def _load_dataset_subset_split(self, subset: str, split: str, required_columns: list[str]):CODE
LOWsentence_transformers/sparse_encoder/model.py602 def set_pooling_include_prompt(self, include_prompt: bool) -> None:CODE
LOWsentence_transformers/sparse_encoder/model.py830 def get_sentence_embedding_dimension(self) -> int | None:CODE
LOWsentence_transformers/sparse_encoder/model.py1118 def splade_pooling_chunk_size(self) -> int | None:CODE
LOWsentence_transformers/sparse_encoder/model.py1139 def splade_pooling_chunk_size(self, value: int | None) -> None:CODE
LOWsentence_transformers/sparse_encoder/model_card.py118 def get_model_specific_metadata(self) -> dict[str, Any]:CODE
LOWsentence_transformers/sparse_encoder/search_engines.py160def semantic_search_elasticsearch(CODE
LOWsentence_transformers/sparse_encoder/search_engines.py428def semantic_search_opensearch(CODE
LOW…ce_transformers/sparse_encoder/losses/cached_splade.py182 def calculate_loss_and_cache_gradients(self, reps: list[list[Tensor]], labels: Tensor | None) -> Tensor:CODE
LOWsentence_transformers/sparse_encoder/losses/flops.py47 def compute_loss_from_embeddings(self, embeddings: torch.Tensor) -> torch.Tensor:CODE
LOWsentence_transformers/sparse_encoder/losses/csr.py15def normalized_mean_squared_error(reconstruction: torch.Tensor, original_input: torch.Tensor) -> torch.Tensor:CODE
LOWsentence_transformers/sparse_encoder/losses/csr.py68 def compute_loss_from_embeddings(self, outputs: list[dict[str, torch.Tensor]]) -> dict[str, torch.Tensor]:CODE
854 more matches not shown…
Cross-File Repetition114 hits · 570 pts
SeverityFileLineSnippetContext
HIGH…nce_transformers/sentence_transformer/training_args.py0basetrainingarguments extends :class:`~transformers.trainingarguments` with additional arguments specific to sentence trSTRING
HIGHsentence_transformers/sparse_encoder/training_args.py0basetrainingarguments extends :class:`~transformers.trainingarguments` with additional arguments specific to sentence trSTRING
HIGHsentence_transformers/base/training_args.py0basetrainingarguments extends :class:`~transformers.trainingarguments` with additional arguments specific to sentence trSTRING
HIGHsentence_transformers/sentence_transformer/trainer.py0basetrainer is a simple but feature-complete training and eval loop for pytorch based on the 🤗 transformers :class:`~traSTRING
HIGHsentence_transformers/cross_encoder/trainer.py0basetrainer is a simple but feature-complete training and eval loop for pytorch based on the 🤗 transformers :class:`~traSTRING
HIGHsentence_transformers/sparse_encoder/trainer.py0basetrainer is a simple but feature-complete training and eval loop for pytorch based on the 🤗 transformers :class:`~traSTRING
HIGHsentence_transformers/base/trainer.py0basetrainer is a simple but feature-complete training and eval loop for pytorch based on the 🤗 transformers :class:`~traSTRING
HIGH…sentence_transformer/losses/batch_semi_hard_triplet.py0batchhardsoftmargintripletloss takes a batch with (input, label) pairs and computes the loss for all possible, valid triSTRING
HIGH…mers/sentence_transformer/losses/batch_hard_triplet.py0batchhardsoftmargintripletloss takes a batch with (input, label) pairs and computes the loss for all possible, valid triSTRING
HIGH…e_transformer/losses/batch_hard_soft_margin_triplet.py0batchhardsoftmargintripletloss takes a batch with (input, label) pairs and computes the loss for all possible, valid triSTRING
HIGH…sentence_transformer/losses/batch_semi_hard_triplet.py0@misc{hermans2017defense, title={in defense of the triplet loss for person re-identification}, author={alexander hermansSTRING
HIGH…rmers/sentence_transformer/losses/batch_all_triplet.py0@misc{hermans2017defense, title={in defense of the triplet loss for person re-identification}, author={alexander hermansSTRING
HIGH…mers/sentence_transformer/losses/batch_hard_triplet.py0@misc{hermans2017defense, title={in defense of the triplet loss for person re-identification}, author={alexander hermansSTRING
HIGH…ce_transformers/sentence_transformer/losses/triplet.py0@misc{hermans2017defense, title={in defense of the triplet loss for person re-identification}, author={alexander hermansSTRING
HIGH…e_transformer/losses/batch_hard_soft_margin_triplet.py0@misc{hermans2017defense, title={in defense of the triplet loss for person re-identification}, author={alexander hermansSTRING
HIGH…ransformer/losses/cached_multiple_negatives_ranking.py0random-state context manager class. reference: https://github.com/luyug/gradcache. this class will back up the pytorch'sSTRING
HIGH…rmers/sentence_transformer/losses/cached_gist_embed.py0random-state context manager class. reference: https://github.com/luyug/gradcache. this class will back up the pytorch'sSTRING
HIGH…ss_encoder/losses/cached_multiple_negatives_ranking.py0random-state context manager class. reference: https://github.com/luyug/gradcache. this class will back up the pytorch'sSTRING
HIGH…ransformer/losses/cached_multiple_negatives_ranking.py0a backward hook to backpropagate the cached gradients mini-batch by mini-batch.STRING
HIGH…rmers/sentence_transformer/losses/cached_gist_embed.py0a backward hook to backpropagate the cached gradients mini-batch by mini-batch.STRING
HIGH…ss_encoder/losses/cached_multiple_negatives_ranking.py0a backward hook to backpropagate the cached gradients mini-batch by mini-batch.STRING
HIGH…ransformer/losses/cached_multiple_negatives_ranking.py0do forward pass on all the minibatches of the input features and yield corresponding embeddings.STRING
HIGH…rmers/sentence_transformer/losses/cached_gist_embed.py0do forward pass on all the minibatches of the input features and yield corresponding embeddings.STRING
HIGH…ss_encoder/losses/cached_multiple_negatives_ranking.py0do forward pass on all the minibatches of the input features and yield corresponding embeddings.STRING
HIGH…ransformers/sentence_transformer/datasets/sentences.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…tence_transformer/datasets/no_duplicates_dataloader.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…transformers/sentence_transformer/datasets/__init__.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…_transformers/sentence_transformer/readers/__init__.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…ormers/sentence_transformer/datasets/sentence_label.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…rs/sentence_transformer/datasets/parallel_sentences.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…_transformers/sentence_transformer/readers/nli_data.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…_transformers/sentence_transformer/readers/sts_data.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…nsformers/sentence_transformer/readers/paired_files.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…sformers/sentence_transformer/readers/input_example.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…formers/sentence_transformer/readers/label_sentence.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…e_transformers/sentence_transformer/readers/triplet.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…entence_transformer/datasets/denoising_auto_encoder.py0this file contains deprecated code that can only be used with the old `model.fit`-style sentence transformers v2.x trainSTRING
HIGH…ransformers/sentence_transformer/modules/clip_model.py0get the default modality configuration for the current transformer task. returns: tuple[modalityconfig, str]: a tuple ofSTRING
HIGH…transformers/sparse_encoder/modules/mlm_transformer.py0get the default modality configuration for the current transformer task. returns: tuple[modalityconfig, str]: a tuple ofSTRING
HIGHsentence_transformers/base/modules/transformer.py0get the default modality configuration for the current transformer task. returns: tuple[modalityconfig, str]: a tuple ofSTRING
HIGHsentence_transformers/cross_encoder/losses/rank_net.py0get configuration parameters for this loss function. returns: dictionary containing the configuration parametersSTRING
HIGHsentence_transformers/cross_encoder/losses/list_net.py0get configuration parameters for this loss function. returns: dictionary containing the configuration parametersSTRING
HIGHsentence_transformers/cross_encoder/losses/plist_mle.py0get configuration parameters for this loss function. returns: dictionary containing the configuration parametersSTRING
HIGHsentence_transformers/cross_encoder/losses/list_mle.py0get configuration parameters for this loss function. returns: dictionary containing the configuration parametersSTRING
HIGH…tence_transformers/cross_encoder/losses/lambda_loss.py0get configuration parameters for this loss function. returns: dictionary containing the configuration parametersSTRING
HIGHsentence_transformers/cross_encoder/losses/adr_mse.py0compute lambdaloss for a batch of queries and their documents. args: inputs: list of (queries, documents_list) labels: gSTRING
HIGHsentence_transformers/cross_encoder/losses/list_net.py0compute lambdaloss for a batch of queries and their documents. args: inputs: list of (queries, documents_list) labels: gSTRING
HIGHsentence_transformers/cross_encoder/losses/plist_mle.py0compute lambdaloss for a batch of queries and their documents. args: inputs: list of (queries, documents_list) labels: gSTRING
HIGH…tence_transformers/cross_encoder/losses/lambda_loss.py0compute lambdaloss for a batch of queries and their documents. args: inputs: list of (queries, documents_list) labels: gSTRING
HIGHtests/sentence_transformer/test_model_card.py0dummy dataset for testing purposes. the dataset looks as follows: { "anchor": ["anchor 1", "anchor 2", ..., "anchor 10"]STRING
HIGHtests/cross_encoder/test_model_card.py0dummy dataset for testing purposes. the dataset looks as follows: { "anchor": ["anchor 1", "anchor 2", ..., "anchor 10"]STRING
HIGHtests/sparse_encoder/test_model_card.py0dummy dataset for testing purposes. the dataset looks as follows: { "anchor": ["anchor 1", "anchor 2", ..., "anchor 10"]STRING
HIGHtests/sentence_transformer/test_compute_embeddings.py0predict() must run the forward pass via __call__ so that model.compile() applies to inference.STRING
HIGHtests/sparse_encoder/test_model.py0predict() must run the forward pass via __call__ so that model.compile() applies to inference.STRING
HIGHtests/cross_encoder/test_model.py0predict() must run the forward pass via __call__ so that model.compile() applies to inference.STRING
HIGH…ransformer/evaluation/test_label_accuracy_evaluator.py0tests the correct computation of evaluation scores from binaryclassificationevaluatorSTRING
HIGH…mer/evaluation/test_binary_classification_evaluator.py0tests the correct computation of evaluation scores from binaryclassificationevaluatorSTRING
HIGH…sformer/evaluation/test_paraphrase_mining_evaluator.py0tests the correct computation of evaluation scores from binaryclassificationevaluatorSTRING
HIGHtests/base/modules/transformer/test_text_generation.py0create a transformer instance and return it with its supported modalities.STRING
HIGHtests/base/modules/transformer/test_fill_mask.py0create a transformer instance and return it with its supported modalities.STRING
54 more matches not shown…
Unused Imports560 hits · 527 pts
SeverityFileLineSnippetContext
LOWsentence_transformers/__init__.py1CODE
LOWsentence_transformers/__init__.py10CODE
LOWsentence_transformers/__init__.py10CODE
LOWsentence_transformers/__init__.py10CODE
LOWsentence_transformers/__init__.py15CODE
LOWsentence_transformers/__init__.py15CODE
LOWsentence_transformers/__init__.py16CODE
LOWsentence_transformers/__init__.py16CODE
LOWsentence_transformers/__init__.py16CODE
LOWsentence_transformers/__init__.py16CODE
LOWsentence_transformers/__init__.py22CODE
LOWsentence_transformers/__init__.py22CODE
LOWsentence_transformers/__init__.py23CODE
LOWsentence_transformers/__init__.py24CODE
LOWsentence_transformers/__init__.py25CODE
LOWsentence_transformers/__init__.py26CODE
LOWsentence_transformers/__init__.py27CODE
LOWsentence_transformers/__init__.py28CODE
LOWsentence_transformers/__init__.py28CODE
LOWsentence_transformers/__init__.py28CODE
LOWsentence_transformers/__init__.py28CODE
LOWsentence_transformers/__init__.py34CODE
LOWsentence_transformers/__init__.py36CODE
LOWsentence_transformers/__init__.py37CODE
LOWsentence_transformers/__init__.py38CODE
LOW…entence_transformer/deprecated_model_card_templates.py6CODE
LOWsentence_transformers/sentence_transformer/__init__.py1CODE
LOWsentence_transformers/sentence_transformer/__init__.py3CODE
LOWsentence_transformers/sentence_transformer/__init__.py4CODE
LOWsentence_transformers/sentence_transformer/__init__.py5CODE
LOWsentence_transformers/sentence_transformer/__init__.py6CODE
LOWsentence_transformers/sentence_transformer/__init__.py7CODE
LOW…nce_transformers/sentence_transformer/training_args.py1CODE
LOW…nce_transformers/sentence_transformer/training_args.py5CODE
LOW…nce_transformers/sentence_transformer/training_args.py5CODE
LOWsentence_transformers/sentence_transformer/model.py1CODE
LOW…nce_transformers/sentence_transformer/data_collator.py1CODE
LOWsentence_transformers/sentence_transformer/trainer.py1CODE
LOWsentence_transformers/sentence_transformer/fit_mixin.py1CODE
LOW…ntence_transformers/sentence_transformer/model_card.py1CODE
LOW…sentence_transformer/losses/batch_semi_hard_triplet.py1CODE
LOW…/losses/cached_multiple_negatives_symmetric_ranking.py1CODE
LOW…ntence_transformers/sentence_transformer/losses/mse.py1CODE
LOW…tence_transformer/losses/multiple_negatives_ranking.py1CODE
LOW…transformers/sentence_transformer/losses/gist_embed.py1CODE
LOW…rmers/sentence_transformer/losses/batch_all_triplet.py1CODE
LOW…ransformers/sentence_transformer/losses/contrastive.py1CODE
LOW…ence_transformers/sentence_transformer/losses/angle.py1CODE
LOW…ransformer/losses/cached_multiple_negatives_ranking.py1CODE
LOW…transformer/losses/global_orthogonal_regularization.py1CODE
LOW…mers/sentence_transformer/losses/batch_hard_triplet.py1CODE
LOW…transformers/sentence_transformer/losses/margin_mse.py1CODE
LOW…e_transformers/sentence_transformer/losses/__init__.py2CODE
LOW…e_transformers/sentence_transformer/losses/__init__.py4CODE
LOW…e_transformers/sentence_transformer/losses/__init__.py6CODE
LOW…e_transformers/sentence_transformer/losses/__init__.py7CODE
LOW…e_transformers/sentence_transformer/losses/__init__.py8CODE
LOW…e_transformers/sentence_transformer/losses/__init__.py9CODE
LOW…e_transformers/sentence_transformer/losses/__init__.py10CODE
LOW…e_transformers/sentence_transformer/losses/__init__.py10CODE
500 more matches not shown…
Self-Referential Comments94 hits · 285 pts
SeverityFileLineSnippetContext
MEDIUMsentence_transformers/sentence_transformer/model.py861 # Create a pool if not provided, but a list of devices isCOMMENT
MEDIUM…transformers/sentence_transformer/losses/gist_embed.py193 # Define the anchor thresholdCOMMENT
MEDIUM…rmers/sentence_transformer/losses/cached_gist_embed.py351 # Define the anchor thresholdCOMMENT
MEDIUM…s/sentence_transformer/evaluation/paraphrase_mining.py66 # Create a mapping from qid to question & a list of duplicates (qid1, qid2)STRING
MEDIUMsentence_transformers/util/retrieval.py163 """This function is deprecated. Use semantic_search instead"""STRING
MEDIUMsentence_transformers/cross_encoder/model.py301 # Create a pool if is not provided, but a list of devices isCOMMENT
MEDIUM…ers/cross_encoder/losses/multiple_negatives_ranking.py137 # Create a mask for each anchor to each candidate index, where the matching positiveCOMMENT
MEDIUMsentence_transformers/cross_encoder/losses/plist_mle.py224 # Create a mask for valid entriesCOMMENT
MEDIUM…ransformers/cross_encoder/evaluation/classification.py51 # Create a list of pairs, and map the labels to the labels that the model knowsSTRING
MEDIUMsentence_transformers/sparse_encoder/model.py728 # Create a pool if not provided, but a list of devices isCOMMENT
MEDIUMsentence_transformers/base/sampler.py533 # Create a random numpy permutation using int32 (or int64 if necessary)COMMENT
MEDIUMsentence_transformers/base/modules/transformer.py2177 # This method is only called if this model has a modules.json, i.e. it's already been savedCOMMENT
MEDIUMsentence_transformers/base/modules/router.py81 # Create an asymmetric model with different encoders for queries and documentsCOMMENT
MEDIUMtests/sentence_transformer/test_model.py1201 # Create a simple dataset with a text columnCOMMENT
MEDIUMtests/sentence_transformer/test_model.py1322 # Create a Router with mixed modulesCOMMENT
MEDIUMtests/sentence_transformer/test_model.py986 # Create a mock model with required promptsCOMMENT
MEDIUMtests/sentence_transformer/test_model.py1043 # Create a mock model with required promptsCOMMENT
MEDIUMtests/sentence_transformer/test_multi_process.py89 # Create a poolCOMMENT
MEDIUMtests/sentence_transformer/test_multi_process.py163 # Create a poolCOMMENT
MEDIUMtests/sentence_transformer/test_trainer.py197 # Create a new model card if a Trainer was initializedCOMMENT
MEDIUMtests/sentence_transformer/test_trainer.py801 # Define a custom batch sampler functionCOMMENT
MEDIUMtests/sentence_transformer/test_trainer.py931 # Define a custom multi-dataset batch sampler functionCOMMENT
MEDIUMtests/util/test_hard_negatives.py1030 # Create a larger dataset with 32 entriesCOMMENT
MEDIUMtests/util/test_hard_negatives.py1145 # Create a dataset with just 2 pairsCOMMENT
MEDIUMtests/cross_encoder/test_model.py753 # Create a simple dataset with a text columnCOMMENT
MEDIUMtests/cross_encoder/test_trainer.py101 # Create a new model card if a Trainer was initializedCOMMENT
MEDIUMtests/sparse_encoder/test_model.py426 # Create a simple dataset with a text columnCOMMENT
MEDIUMtests/sparse_encoder/test_model.py136 # Create an empty sparse tensorCOMMENT
MEDIUMtests/sparse_encoder/test_model.py171 # Create a batch where the first sample has values but the second is all zerosCOMMENT
MEDIUMtests/sparse_encoder/test_multi_process.py62 # Create a poolCOMMENT
MEDIUMtests/sparse_encoder/modules/test_csr.py11# Create a wrapper to measure outputs of the forward methodCOMMENT
MEDIUMtests/sparse_encoder/modules/test_csr.py61 # Create the wrapper and replace the forward methodCOMMENT
MEDIUMtests/base/samplers/test_no_duplicates_batch_sampler.py39 # Create a list of two 0's, two 1's, two 2's, ... two 49's. Then shuffle.COMMENT
MEDIUMtests/base/modules/test_router.py683 # Create a Router with different module configurations for each routeCOMMENT
MEDIUMtests/base/modules/test_router.py693 # Create a SentenceTransformer with static_embedding followed by routerCOMMENT
MEDIUMtests/base/modules/test_router.py67# Create a custom ModuleDict subclass to track accessCOMMENT
MEDIUMtests/base/modules/test_router.py209 # Create a Router with StaticEmbedding modulesCOMMENT
MEDIUMtests/base/modules/test_router.py313 # Create a Router with StaticEmbedding modulesCOMMENT
MEDIUMtests/base/modules/test_router.py439 # Create a Router with StaticEmbedding modulesCOMMENT
MEDIUMtests/base/modules/test_router.py457 # Create a loss function that works with routerCOMMENT
MEDIUMtests/base/modules/test_router.py481 # Create a Router with StaticEmbedding modulesCOMMENT
MEDIUMtests/base/modules/test_router.py493 # Create a loss function that works with routerCOMMENT
MEDIUMtests/base/modules/test_router.py1356 # Create an object that will fail modality inferenceCOMMENT
MEDIUMtests/base/modules/test_dense.py92 # Create a Dense layer with custom keysCOMMENT
MEDIUM…raining/data_augmentation/train_sts_qqp_crossdomain.py182# Define the training argumentsCOMMENT
MEDIUM…/training/data_augmentation/train_sts_indomain_bm25.py216# Define the training argumentsCOMMENT
MEDIUM…/training/data_augmentation/train_sts_indomain_bm25.py237# Create the trainer & start trainingCOMMENT
MEDIUM…raining/data_augmentation/train_sts_indomain_nlpaug.py137# Define the training argumentsCOMMENT
MEDIUM…raining/data_augmentation/train_sts_indomain_nlpaug.py158# Create the trainer & start trainingCOMMENT
MEDIUM…ining/data_augmentation/train_sts_indomain_semantic.py226# Define the training argumentsCOMMENT
MEDIUM…transformer/training/other/training_batch_hard_trec.py45 # Create a dev set from train setCOMMENT
MEDIUM…ansformer/training/other/training_gooaq_infonce_gor.py42# Define a custom loss that combines InfoNCE and Global Orthogonal RegularizationCOMMENT
MEDIUM…ransformer/training/distillation/model_distillation.py111# Create a relatively small dataset for evaluationCOMMENT
MEDIUM…ransformer/training/distillation/model_distillation.py116# Create an STSB evaluatorCOMMENT
MEDIUM…ransformer/training/distillation/model_distillation.py165# Define the training argumentsCOMMENT
MEDIUM…ransformer/training/distillation/model_distillation.py189# Create the trainer & start trainingCOMMENT
MEDIUM…ing/distillation/model_distillation_layer_reduction.py58# Create a smaller student model by using only some of the teacher layersCOMMENT
MEDIUM…ing/distillation/model_distillation_layer_reduction.py134# Create a relatively small dataset for evaluationCOMMENT
MEDIUM…ing/distillation/model_distillation_layer_reduction.py169# Create an STSB evaluatorCOMMENT
MEDIUM…ing/distillation/model_distillation_layer_reduction.py188# Define the training argumentsCOMMENT
34 more matches not shown…
Excessive Try-Catch Wrapping178 hits · 180 pts
SeverityFileLineSnippetContext
LOW…entence_transformer/deprecated_model_card_templates.py189 except Exception as e:CODE
MEDIUM…entence_transformer/deprecated_model_card_templates.py160def get_train_objective_info(dataloader, loss):CODE
LOW…nsformers/sentence_transformer/evaluation/nano_beir.py477 except Exception as e:CODE
LOWsentence_transformers/util/hard_negatives.py463 except Exception:CODE
LOWsentence_transformers/util/logging.py19 except Exception:CODE
MEDIUMsentence_transformers/util/logging.py12def emit(self, record) -> None:CODE
LOWsentence_transformers/util/misc.py69 except Exception:CODE
LOWsentence_transformers/util/file_io.py192 except Exception as first_error:CODE
LOWsentence_transformers/util/file_io.py249 except Exception:CODE
LOWsentence_transformers/cross_encoder/model.py387 except Exception as e:CODE
LOWsentence_transformers/cross_encoder/model.py391 except Exception:CODE
LOW…nce_transformers/cross_encoder/evaluation/nano_beir.py398 except Exception as e:CODE
LOWsentence_transformers/sparse_encoder/model.py793 except Exception as e:CODE
LOWsentence_transformers/sparse_encoder/model.py797 except Exception:CODE
LOWsentence_transformers/base/model.py778 except Exception:CODE
LOWsentence_transformers/base/model.py944 except Exception as exc:CODE
LOWsentence_transformers/base/model.py1117 except Exception as exc:CODE
LOWsentence_transformers/base/model.py1127 except Exception:CODE
LOWsentence_transformers/base/trainer.py685 except Exception:CODE
LOWsentence_transformers/base/trainer.py690 except Exception as exc:CODE
MEDIUMsentence_transformers/base/model_card.py1424def try_to_float(metric_value):CODE
LOWsentence_transformers/base/model_card.py1318 except Exception:CODE
LOWsentence_transformers/base/model_card.py1937 except Exception as exc:CODE
LOWsentence_transformers/base/model_card.py1945 except Exception as exc:CODE
LOWsentence_transformers/base/model_card.py1953 except Exception as exc:CODE
LOWsentence_transformers/base/model_card.py1960 except Exception as exc:CODE
LOWsentence_transformers/base/model_card.py456 except Exception:CODE
LOWsentence_transformers/base/model_card.py851 except Exception:CODE
LOWsentence_transformers/base/model_card.py894 except Exception:CODE
LOWsentence_transformers/base/model_card.py1387 except Exception:CODE
LOWsentence_transformers/base/model_card.py1427 except Exception:CODE
LOWsentence_transformers/base/model_card.py1557 except Exception:CODE
LOWsentence_transformers/base/model_card.py1565 except Exception:CODE
LOWsentence_transformers/base/model_card.py1587 except Exception:CODE
LOWsentence_transformers/base/model_card.py1842 except Exception:CODE
LOWsentence_transformers/base/model_card.py1894 except Exception:CODE
LOWsentence_transformers/base/model_card.py1905 except Exception as exc:CODE
LOWsentence_transformers/base/model_card.py1911 except Exception as exc:CODE
LOWsentence_transformers/base/model_card.py1922 except Exception as exc:CODE
LOWsentence_transformers/base/model_card.py495 except Exception:STRING
LOWsentence_transformers/base/modules/transformer.py1511 except Exception as exc:CODE
LOWsentence_transformers/base/modules/transformer.py1549 except Exception as exc: # never let suffix derivation break tokenizationCODE
LOWsentence_transformers/base/modules/transformer.py1972 except Exception:CODE
LOWtests/cross_encoder/test_model_card.py290 except Exception:CODE
LOWtests/sparse_encoder/test_pretrained.py142 except Exception as e:CODE
LOWtests/sparse_encoder/test_pretrained.py153 except Exception as e:CODE
LOWtests/sparse_encoder/test_pretrained.py183 except Exception as e:CODE
LOWtests/sparse_encoder/test_trainer.py127 except Exception as e:CODE
LOWtests/base/test_model_card.py281 except Exception:CODE
LOWtests/base/test_modality.py694 except Exception as exc:CODE
LOWtests/base/modules/transformer/test_text_generation.py87 except Exception as e:CODE
LOWtests/base/modules/transformer/conftest.py197 except Exception as e:CODE
LOWtests/base/modules/transformer/conftest.py722 except Exception:CODE
LOWtests/base/modules/transformer/test_fill_mask.py78 except Exception as e:CODE
LOW…ts/base/modules/transformer/test_feature_extraction.py89 except Exception as e:CODE
LOWtests/base/modules/transformer/test_any_to_any.py95 except Exception as e:CODE
LOW…se/modules/transformer/test_sequence_classification.py87 except Exception as e:CODE
LOWdocs/cross_encoder/training_overview.md865 except Exception:CODE
LOWdocs/cross_encoder/training_overview.md1069 except Exception:CODE
LOW…ples/sentence_transformer/training/nli/training_nli.py117except Exception:CODE
118 more matches not shown…
Modern Structural Boilerplate111 hits · 109 pts
SeverityFileLineSnippetContext
LOWsentence_transformers/__init__.py51__all__ = [CODE
LOWsentence_transformers/sentence_transformer/__init__.py9__all__ = [CODE
LOW…nce_transformers/sentence_transformer/training_args.py53__all__ = ["SentenceTransformerTrainingArguments", "BatchSamplers", "MultiDatasetBatchSamplers"]STRING
LOWsentence_transformers/sentence_transformer/model.py931 def set_pooling_include_prompt(self, include_prompt: bool) -> None:CODE
LOWsentence_transformers/sentence_transformer/trainer.py33logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/sentence_transformer/fit_mixin.py33logger = logging.getLogger(__name__)CODE
LOW…tence_transformer/losses/multiple_negatives_ranking.py14logger = logging.getLogger(__name__)CODE
LOW…ransformer/losses/cached_multiple_negatives_ranking.py19logger = logging.getLogger(__name__)CODE
LOW…e_transformers/sentence_transformer/losses/__init__.py38__all__ = [CODE
LOW…transformers/sentence_transformer/losses/matryoshka.py19logger = logging.getLogger(__name__)CODE
LOW…transformers/sentence_transformer/losses/matryoshka.py50 def set_dim(self, dim) -> None:CODE
LOW…/sentence_transformer/losses/denoising_auto_encoder.py13logger = logging.getLogger(__name__)CODE
LOW…sformers/sentence_transformer/losses/adaptive_layer.py37 def set_layer_idx(self, layer_idx) -> None:CODE
LOW…ce_transformers/sentence_transformer/losses/softmax.py15logger = logging.getLogger(__name__)CODE
LOW…transformers/sentence_transformer/datasets/__init__.py17__all__ = [CODE
LOW…ormers/sentence_transformer/datasets/sentence_label.py20logger = logging.getLogger(__name__)CODE
LOW…rs/sentence_transformer/datasets/parallel_sentences.py22logger = logging.getLogger(__name__)CODE
LOW…ce_transformers/sentence_transformer/evaluation/mse.py15logger = logging.getLogger(__name__)CODE
LOW…ntence_transformer/evaluation/information_retrieval.py21logger = logging.getLogger(__name__)CODE
LOW…/sentence_transformer/evaluation/mse_from_dataframe.py17logger = logging.getLogger(__name__)CODE
LOW…ansformers/sentence_transformer/evaluation/__init__.py20__all__ = [CODE
LOW…ntence_transformer/evaluation/binary_classification.py24logger = logging.getLogger(__name__)CODE
LOW…nsformers/sentence_transformer/evaluation/reranking.py23logger = logging.getLogger(__name__)CODE
LOW…formers/sentence_transformer/evaluation/translation.py19logger = logging.getLogger(__name__)CODE
LOW…ransformers/sentence_transformer/evaluation/triplet.py23logger = logging.getLogger(__name__)CODE
LOW…s/sentence_transformer/evaluation/paraphrase_mining.py15logger = logging.getLogger(__name__)CODE
LOW…mers/sentence_transformer/evaluation/label_accuracy.py17logger = logging.getLogger(__name__)CODE
LOW…nsformers/sentence_transformer/evaluation/nano_beir.py22logger = logging.getLogger(__name__)CODE
LOW…entence_transformer/evaluation/embedding_similarity.py24logger = logging.getLogger(__name__)CODE
LOW…_transformers/sentence_transformer/readers/__init__.py18__all__ = [CODE
LOW…_transformers/sentence_transformer/modules/__init__.py23__all__ = [CODE
LOW…ransformers/sentence_transformer/modules/clip_model.py8logger = logging.getLogger(__name__)CODE
LOW…tence_transformers/sentence_transformer/modules/bow.py13logger = logging.getLogger(__name__)CODE
LOW…ormers/sentence_transformer/modules/word_embeddings.py24logger = logging.getLogger(__name__)CODE
LOW…rmers/sentence_transformer/modules/static_embedding.py25logger = logging.getLogger(__name__)CODE
LOW…nsformers/sentence_transformer/modules/word_weights.py10logger = logging.getLogger(__name__)CODE
LOW…ers/sentence_transformer/modules/tokenizer/__init__.py7__all__ = [CODE
LOW…rmers/sentence_transformer/modules/tokenizer/phrase.py14logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/util/hard_negatives.py16logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/util/quantization.py10logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/util/__init__.py58__all__ = [CODE
LOWsentence_transformers/util/retrieval.py17logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/util/environment.py13logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/util/file_io.py11logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/backend/optimize.py8logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/backend/quantize.py9logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/backend/__init__.py8__all__ = [CODE
LOWsentence_transformers/backend/utils.py18logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/backend/load.py11logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/cross_encoder/__init__.py9__all__ = [CODE
LOWsentence_transformers/cross_encoder/trainer.py31logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/cross_encoder/fit_mixin.py36logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/cross_encoder/model_card.py27logger = logging.getLogger(__name__)CODE
LOWsentence_transformers/cross_encoder/model_card.py100 def set_widget_examples(self, dataset: Dataset | DatasetDict) -> None:CODE
LOWsentence_transformers/cross_encoder/losses/__init__.py23__all__ = [CODE
LOW…ransformers/cross_encoder/evaluation/classification.py17logger = logging.getLogger(__name__)CODE
LOW…ence_transformers/cross_encoder/evaluation/__init__.py16__all__ = [CODE
LOW…nce_transformers/cross_encoder/evaluation/reranking.py16logger = logging.getLogger(__name__)CODE
LOW…e_transformers/cross_encoder/evaluation/correlation.py16logger = logging.getLogger(__name__)CODE
LOW…nce_transformers/cross_encoder/evaluation/nano_beir.py18logger = logging.getLogger(__name__)CODE
51 more matches not shown…
Docstring Block Structure19 hits · 95 pts
SeverityFileLineSnippetContext
HIGHsentence_transformers/sentence_transformer/trainer.py37 SentenceTransformerTrainer is a simple but feature-complete training and eval loop for PyTorch based on the 🤗 TSTRING
HIGH…rmers/sentence_transformer/modules/static_embedding.py182 Creates a StaticEmbedding instance from a distillation process using the `model2vec` package. Args: STRING
HIGH…rmers/sentence_transformer/modules/static_embedding.py245 Create a StaticEmbedding instance from a model2vec model. This method loads a pre-trained model2vec model STRING
HIGHsentence_transformers/util/misc.py41 Import a dotted module path and return the attribute/class designated by the last name in the path. Raise ImporSTRING
HIGHsentence_transformers/util/similarity.py264 Converts a similarity function name or enum value to the corresponding similarity function. Args: STRING
HIGHsentence_transformers/util/similarity.py302 Converts a similarity function into a pairwise similarity function. The pairwise similarity function rSTRING
HIGHsentence_transformers/util/quantization.py31 Performs semantic search using the FAISS library. Rescoring will be performed if: 1. `rescore` is True STRING
HIGHsentence_transformers/util/quantization.py198 Performs semantic search using the usearch library. Rescoring will be performed if: 1. `rescore` is True STRING
HIGHsentence_transformers/util/tensor.py152 Returns a new tensor with only the top-k values (in absolute terms) of each embedding, all others set to zero. STRING
HIGHsentence_transformers/util/file_io.py41 Checks if the given model name or path corresponds to a SentenceTransformer model. Args: model_name_orSTRING
HIGHsentence_transformers/util/file_io.py82 Loads a file from a local or remote location. Args: model_name_or_path (str): The model name or path. STRING
HIGHsentence_transformers/util/file_io.py141 Loads the subfolder path for a given model name or path. Args: model_name_or_path (str): The name or pSTRING
HIGHsentence_transformers/util/file_io.py206Download a URL to a local file with a progress bar. The content is streamed in chunks and first written to a temporSTRING
HIGHsentence_transformers/backend/optimize.py27 Export an optimized ONNX model from a SentenceTransformer, SparseEncoder, or CrossEncoder model. The O1-O4 optSTRING
HIGHsentence_transformers/backend/quantize.py32 Export a quantized ONNX model from a SentenceTransformer, SparseEncoder, or CrossEncoder model. This function STRING
HIGHsentence_transformers/backend/quantize.py119 Export a quantized OpenVINO model from a SentenceTransformer, SparseEncoder, or CrossEncoder model. This functSTRING
HIGHsentence_transformers/cross_encoder/model.py560 Performs predictions with the CrossEncoder on the given input pairs. .. tip:: Adjusting `STRING
HIGHsentence_transformers/base/modality.py556Infer the modality of a single input sample by inspecting its type/structure. Pure type-based detection, does not rSTRING
HIGHsentence_transformers/base/modules/module.py311 A utility function to load the PyTorch weights of a model from a checkpoint. The checkpoint can be either a STRING
Deep Nesting91 hits · 82 pts
SeverityFileLineSnippetContext
LOWsentence_transformers/sentence_transformer/model.py485CODE
LOWsentence_transformers/sentence_transformer/model.py843CODE
LOWsentence_transformers/sentence_transformer/model.py908CODE
LOWsentence_transformers/sentence_transformer/fit_mixin.py63CODE
LOWsentence_transformers/sentence_transformer/fit_mixin.py407CODE
LOWsentence_transformers/sentence_transformer/fit_mixin.py465CODE
LOW…tence_transformer/losses/multiple_negatives_ranking.py237CODE
LOW…ransformer/losses/cached_multiple_negatives_ranking.py83CODE
LOW…ransformer/losses/cached_multiple_negatives_ranking.py171CODE
LOW…ransformer/losses/cached_multiple_negatives_ranking.py445CODE
LOW…transformers/sentence_transformer/losses/matryoshka.py92CODE
LOW…rmers/sentence_transformer/losses/cached_gist_embed.py64CODE
LOW…tence_transformer/datasets/no_duplicates_dataloader.py29CODE
LOW…ntence_transformer/evaluation/information_retrieval.py299CODE
LOW…ntence_transformer/evaluation/information_retrieval.py447CODE
LOW…formers/sentence_transformer/evaluation/translation.py102CODE
LOW…s/sentence_transformer/evaluation/paraphrase_mining.py245CODE
LOW…e_transformers/sentence_transformer/modules/pooling.py163CODE
LOW…e_transformers/sentence_transformer/modules/pooling.py237CODE
LOW…rmers/sentence_transformer/modules/tokenizer/phrase.py63CODE
LOWsentence_transformers/util/hard_negatives.py25CODE
LOWsentence_transformers/util/deprecated_import.py210CODE
LOWsentence_transformers/util/quantization.py18CODE
LOWsentence_transformers/util/quantization.py185CODE
LOWsentence_transformers/util/quantization.py371CODE
LOWsentence_transformers/util/retrieval.py89CODE
LOWsentence_transformers/util/retrieval.py167CODE
LOWsentence_transformers/util/retrieval.py258CODE
LOWsentence_transformers/util/environment.py51CODE
LOWsentence_transformers/util/file_io.py205CODE
LOWsentence_transformers/util/decorators.py92CODE
LOWsentence_transformers/util/decorators.py115CODE
LOWsentence_transformers/backend/utils.py155CODE
LOWsentence_transformers/cross_encoder/model.py283CODE
LOWsentence_transformers/cross_encoder/model.py357CODE
LOWsentence_transformers/cross_encoder/fit_mixin.py61CODE
LOWsentence_transformers/cross_encoder/fit_mixin.py417CODE
LOWsentence_transformers/sparse_encoder/model.py711CODE
LOW…rs/sparse_encoder/evaluation/reciprocal_rank_fusion.py105CODE
LOW…_transformers/sparse_encoder/modules/splade_pooling.py65CODE
LOWsentence_transformers/base/model.py854CODE
LOWsentence_transformers/base/model.py1052CODE
LOWsentence_transformers/base/modality.py232CODE
LOWsentence_transformers/base/modality.py446CODE
LOWsentence_transformers/base/modality.py470CODE
LOWsentence_transformers/base/data_collator.py114CODE
LOWsentence_transformers/base/trainer.py392CODE
LOWsentence_transformers/base/trainer.py417CODE
LOWsentence_transformers/base/trainer.py532CODE
LOWsentence_transformers/base/trainer.py815CODE
LOWsentence_transformers/base/trainer.py1206CODE
LOWsentence_transformers/base/model_card.py429CODE
LOWsentence_transformers/base/model_card.py512CODE
LOWsentence_transformers/base/model_card.py594CODE
LOWsentence_transformers/base/model_card.py696CODE
LOWsentence_transformers/base/model_card.py792CODE
LOWsentence_transformers/base/model_card.py1361CODE
LOWsentence_transformers/base/model_card.py1889CODE
LOWsentence_transformers/base/modules/transformer.py456CODE
LOWsentence_transformers/base/modules/transformer.py589CODE
31 more matches not shown…
AI Structural Patterns63 hits · 60 pts
SeverityFileLineSnippetContext
LOWsentence_transformers/sentence_transformer/model.py149CODE
LOWsentence_transformers/sentence_transformer/model.py222CODE
LOWsentence_transformers/sentence_transformer/model.py281CODE
LOWsentence_transformers/sentence_transformer/model.py344CODE
LOWsentence_transformers/sentence_transformer/model.py364CODE
LOWsentence_transformers/sentence_transformer/model.py384CODE
LOWsentence_transformers/sentence_transformer/model.py404CODE
LOWsentence_transformers/sentence_transformer/model.py424CODE
LOWsentence_transformers/sentence_transformer/model.py444CODE
LOWsentence_transformers/sentence_transformer/model.py464CODE
LOWsentence_transformers/sentence_transformer/model.py485CODE
LOWsentence_transformers/sentence_transformer/model.py809CODE
LOWsentence_transformers/sentence_transformer/trainer.py118CODE
LOWsentence_transformers/sentence_transformer/fit_mixin.py161CODE
LOWsentence_transformers/sentence_transformer/fit_mixin.py465CODE
LOW…ransformer/losses/cached_multiple_negatives_ranking.py199CODE
LOW…rmers/sentence_transformer/losses/cached_gist_embed.py92CODE
LOW…ntence_transformer/evaluation/information_retrieval.py131CODE
LOW…nsformers/sentence_transformer/evaluation/reranking.py90CODE
LOW…ransformers/sentence_transformer/evaluation/triplet.py84CODE
LOW…s/sentence_transformer/evaluation/paraphrase_mining.py92CODE
LOW…nsformers/sentence_transformer/evaluation/nano_beir.py214CODE
LOW…entence_transformer/evaluation/embedding_similarity.py82CODE
LOW…_transformers/sentence_transformer/readers/sts_data.py26CODE
LOW…_transformers/sentence_transformer/readers/sts_data.py78CODE
LOW…ormers/sentence_transformer/modules/word_embeddings.py91CODE
LOW…rmers/sentence_transformer/modules/static_embedding.py169CODE
LOWsentence_transformers/util/hard_negatives.py25CODE
LOWsentence_transformers/util/quantization.py18CODE
LOWsentence_transformers/util/quantization.py185CODE
LOWsentence_transformers/util/retrieval.py23CODE
LOWsentence_transformers/cross_encoder/model.py150CODE
LOWsentence_transformers/cross_encoder/model.py471CODE
LOWsentence_transformers/cross_encoder/model.py489CODE
LOWsentence_transformers/cross_encoder/model.py507CODE
LOWsentence_transformers/cross_encoder/model.py525CODE
LOWsentence_transformers/cross_encoder/model.py544CODE
LOWsentence_transformers/cross_encoder/model.py721CODE
LOWsentence_transformers/cross_encoder/trainer.py114CODE
LOWsentence_transformers/cross_encoder/fit_mixin.py182CODE
LOWsentence_transformers/cross_encoder/fit_mixin.py417CODE
LOW…nce_transformers/cross_encoder/evaluation/reranking.py105CODE
LOW…nce_transformers/cross_encoder/evaluation/nano_beir.py197CODE
LOWsentence_transformers/sparse_encoder/model.py144CODE
LOWsentence_transformers/sparse_encoder/model.py199CODE
LOWsentence_transformers/sparse_encoder/model.py272CODE
LOWsentence_transformers/sparse_encoder/model.py348CODE
LOWsentence_transformers/sparse_encoder/trainer.py114CODE
LOW…ce_transformers/sparse_encoder/losses/cached_splade.py26CODE
LOW…rse_encoder/evaluation/sparse_information_retrieval.py136CODE
LOW…ansformers/sparse_encoder/evaluation/sparse_triplet.py98CODE
LOW…sformers/sparse_encoder/evaluation/sparse_nano_beir.py200CODE
LOW…sformers/sparse_encoder/evaluation/sparse_reranking.py110CODE
LOWsentence_transformers/base/model.py81CODE
LOWsentence_transformers/base/model.py790CODE
LOWsentence_transformers/base/model.py854CODE
LOWsentence_transformers/base/trainer.py149CODE
LOWsentence_transformers/base/trainer.py1181CODE
LOWsentence_transformers/base/model_card.py1813CODE
LOWsentence_transformers/base/modules/transformer.py589CODE
3 more matches not shown…
Modern AI Meta-Vocabulary22 hits · 60 pts
SeverityFileLineSnippetContext
MEDIUMsentence_transformers/base/modules/router.py72 # Use a regular SentenceTransformer for the document embeddings, and a static embedding model for the quCOMMENT
MEDIUMdocs/migration_guide.md475 # and a static embedding model for the query embeddingsCOMMENT
MEDIUMdocs/migration_guide.md502 # and a static embedding model for the query embeddingsCOMMENT
MEDIUMdocs/cross_encoder/training_overview.md323 # Mine hard negatives using a very efficient embedding modelCOMMENT
MEDIUMdocs/cross_encoder/training_overview.md335 batch_size=4096, # Use a batch size of 4096 for the embedding modelCODE
MEDIUMdocs/cross_encoder/training_overview.md606 # Mine hard negatives using a very efficient embedding modelCOMMENT
MEDIUMdocs/cross_encoder/training_overview.md613 batch_size=4096, # Use a batch size of 4096 for the embedding modelCODE
MEDIUMdocs/cross_encoder/training_overview.md954 # 2b. Modify our training dataset to include hard negatives using a very efficient embedding modelCOMMENT
MEDIUMdocs/cross_encoder/training_overview.md964 batch_size=4096, # Use a batch size of 4096 for the embedding modelCODE
MEDIUMdocs/cross_encoder/training_overview.md987 # embedding model as a baseline.COMMENT
MEDIUM…nsformer/applications/embedding-quantization/README.md37# 1. Load an embedding modelCOMMENT
MEDIUM…nsformer/applications/embedding-quantization/README.md109# 1. Load an embedding modelCOMMENT
MEDIUM…rmer/applications/parallel-sentence-mining/bucc2018.py62# Use PCA to reduce the dimensionality of the sentence embedding modelCOMMENT
MEDIUM…cross_encoder/training/rerankers/training_gooaq_bce.py54 # 2b. Modify our training dataset to include hard negatives using a very efficient embedding modelCOMMENT
MEDIUM…cross_encoder/training/rerankers/training_gooaq_bce.py64 batch_size=4096, # Use a batch size of 4096 for the embedding modelCODE
MEDIUM…cross_encoder/training/rerankers/training_gooaq_bce.py87 # embedding model as a baseline.COMMENT
MEDIUM…ss_encoder/training/rerankers/training_gooaq_lambda.py54 # 2b. Modify our training dataset to include hard negatives using a very efficient embedding modelCOMMENT
MEDIUM…ss_encoder/training/rerankers/training_gooaq_lambda.py64 batch_size=4096, # Use a batch size of 4096 for the embedding modelCODE
MEDIUM…ss_encoder/training/rerankers/training_gooaq_lambda.py86 # embedding model as a baseline.COMMENT
MEDIUM…es/cross_encoder/training/rerankers/training_nq_bce.py54 # 2b. Modify our training dataset to include hard negatives using a very efficient embedding modelCOMMENT
MEDIUM…es/cross_encoder/training/rerankers/training_nq_bce.py64 batch_size=4096, # Use a batch size of 4096 for the embedding modelCODE
MEDIUM…es/cross_encoder/training/rerankers/training_nq_bce.py87 # embedding model as a baseline.COMMENT
Redundant / Tautological Comments42 hits · 55 pts
SeverityFileLineSnippetContext
LOW…mers/sentence_transformer/losses/batch_hard_triplet.py240 # Check if labels[i] == labels[j]COMMENT
LOW…mers/sentence_transformer/losses/batch_hard_triplet.py254 # Check if labels[i] != labels[k]COMMENT
LOWsentence_transformers/util/tensor.py23 # Check if list contains sparse tensorsCOMMENT
LOWsentence_transformers/util/retrieval.py332 # Check if we need to increase sort_max_sizeCOMMENT
LOWsentence_transformers/cross_encoder/model_card.py211 # Check if any pair element is non-text (from usage_examples before asset saving)COMMENT
LOW…arse_encoder/evaluation/sparse_embedding_similarity.py78 # Print the resultsSTRING
LOW…rse_encoder/evaluation/sparse_information_retrieval.py128 # Print the resultsSTRING
LOW…ansformers/sparse_encoder/evaluation/sparse_triplet.py90 # Print the resultsSTRING
LOW…sformers/sparse_encoder/evaluation/sparse_nano_beir.py171 # Print the resultsSTRING
LOW…rse_encoder/evaluation/sparse_binary_classification.py104 # Print the resultsSTRING
LOW…e_transformers/sparse_encoder/evaluation/sparse_mse.py78 # Print the resultsSTRING
LOW…ormers/sparse_encoder/evaluation/sparse_translation.py75 # Print the resultsSTRING
LOW…sformers/sparse_encoder/evaluation/sparse_reranking.py102 # Print the resultsSTRING
LOW…mers/sparse_encoder/modules/sparse_static_embedding.py202 # Check if we have a JSON path in configCOMMENT
LOWsentence_transformers/base/model.py995 # Check if this is a Sentence Transformer modelCOMMENT
LOWsentence_transformers/base/model.py1081 # Check if the config_sentence_transformers.json file exists (exists since v2 of the framework)COMMENT
LOWsentence_transformers/base/model.py1106 # Check if a readme exists. README is optional metadata; a transient Hub errorCOMMENT
LOWsentence_transformers/base/model.py1160 # Check if the `load` method only accepts a single parameter (the path to the local directory).COMMENT
LOWsentence_transformers/base/model_card.py651 # Check if the model has a tuple modality whose parts all match available columns.STRING
LOWtests/sparse_encoder/utils.py26 # Check if shape matchesCOMMENT
LOWtests/sparse_encoder/utils.py40 # Check if indices are the sameCOMMENT
LOWtests/sparse_encoder/utils.py44 # Check if values are closeCOMMENT
LOWtests/sparse_encoder/test_trainer.py116 # Check if model parameters have changed after trainingCOMMENT
LOW…sparse_encoder/modules/test_sparse_static_embedding.py55 # Check if embeddings are the same before and after save/loadCOMMENT
LOW…sparse_encoder/modules/test_sparse_static_embedding.py58 # Check if SparseStaticEmbedding weights are maintained after loadingCOMMENT
LOW…modules/transformer/update_transformers_tiny_models.py42 # Check if the model_id contains the architecture nameCOMMENT
LOW…er/training/quora_duplicate_questions/create_splits.py510####### Write files for Information Retrieval #####COMMENT
LOW…/embedding-quantization/semantic_search_recommended.py120 # Output the resultsCOMMENT
LOW…tions/semantic-search/semantic_search_quora_pytorch.py34# Check if embedding cache path existsCOMMENT
LOW…cations/semantic-search/semantic_search_quora_annoy.py55# Check if embedding cache path existsCOMMENT
LOW…tions/semantic-search/semantic_search_quora_hnswlib.py45# Check if embedding cache path existsCOMMENT
LOW…cations/semantic-search/semantic_search_quora_faiss.py59# Check if embedding cache path existsCOMMENT
LOW…/cross_encoder/applications/cross_encoder_reranking.py41# Check if embedding cache path existsCOMMENT
LOW…parse_encoder/evaluation/sparse_reranking_evaluator.py53# Print the resultsCOMMENT
LOW…coder/evaluation/sparse_nanobeir_advanced_evaluator.py45# Print the resultsCOMMENT
LOW…arse_encoder/evaluation/sparse_similarity_evaluator.py31# Print the resultsCOMMENT
LOW…rse_encoder/evaluation/sparse_translation_evaluator.py30# Print the resultsCOMMENT
LOW…/sparse_encoder/evaluation/sparse_triplet_evaluator.py37# Print the resultsCOMMENT
LOW…parse_encoder/evaluation/sparse_retrieval_evaluator.py69# Print the resultsCOMMENT
LOW…sparse_encoder/evaluation/sparse_nanobeir_evaluator.py94# Print the resultsCOMMENT
LOW…_encoder/evaluation/sparse_classification_evaluator.py58# Print the resultsCOMMENT
LOW…ples/sparse_encoder/evaluation/sparse_mse_evaluator.py32# Print the resultsCOMMENT
AI Slop Vocabulary7 hits · 14 pts
SeverityFileLineSnippetContext
LOW…transformers/sentence_transformer/losses/gist_embed.py243 # so the label for anchor[i] is i. This means that we can just use arangeCOMMENT
LOW…rmers/sentence_transformer/losses/cached_gist_embed.py334 # so the label for anchor[i] is i. This means that we can just use arangeCOMMENT
LOWsentence_transformers/base/trainer.py514 # if loss is nan or inf simply add the average of previous logged lossesCOMMENT
LOWsentence_transformers/base/trainer.py567 # would not accept it. If None, we just call the super().log() method without it so that it works with all versiCOMMENT
LOWsentence_transformers/base/trainer.py644 # If the evaluator is not defined, we can just return the outputCOMMENT
MEDIUM…applications/parallel-sentence-mining/bitext_mining.py27# Model we want to use for bitext mining. sentence-transformers/LaBSE achieves state-of-the-art performanceCOMMENT
MEDIUM…rmer/applications/parallel-sentence-mining/bucc2018.py25# Model we want to use for bitext mining. sentence-transformers/LaBSE achieves state-of-the-art performanceCOMMENT
Verbosity Indicators9 hits · 14 pts
SeverityFileLineSnippetContext
LOW…raining/data_augmentation/train_sts_qqp_crossdomain.py102# Step 1: Train cross-encoder model with STSbenchmarkCOMMENT
LOW…raining/data_augmentation/train_sts_qqp_crossdomain.py141# Step 2: Label QQP train dataset using cross-encoder (BERT) modelCOMMENT
LOW…raining/data_augmentation/train_sts_qqp_crossdomain.py158# Step 3: Train bi-encoder (SBERT) model with QQP dataset - Augmented SBERTCOMMENT
LOW…/training/data_augmentation/train_sts_indomain_bm25.py89# Step 1: Train cross-encoder model with (gold) STS benchmark datasetCOMMENT
LOW…/training/data_augmentation/train_sts_indomain_bm25.py135# Step 2: Label BM25 sampled STSb (silver dataset) using cross-encoder modelCOMMENT
LOW…/training/data_augmentation/train_sts_indomain_bm25.py188# Step 3: Train bi-encoder model with both (gold + silver) STSbenchmark dataset - Augmented SBERTCOMMENT
LOW…ining/data_augmentation/train_sts_indomain_semantic.py101# Step 1: Train cross-encoder model with STSbenchmarkCOMMENT
LOW…ining/data_augmentation/train_sts_indomain_semantic.py140# Step 2: Find silver pairs to labelCOMMENT
LOW…ining/data_augmentation/train_sts_indomain_semantic.py199# Step 3: Train bi-encoder model with both STSbenchmark and labeled AllNlI - Augmented SBERTCOMMENT
Structural Annotation Overuse9 hits · 14 pts
SeverityFileLineSnippetContext
LOW…raining/data_augmentation/train_sts_qqp_crossdomain.py102# Step 1: Train cross-encoder model with STSbenchmarkCOMMENT
LOW…raining/data_augmentation/train_sts_qqp_crossdomain.py141# Step 2: Label QQP train dataset using cross-encoder (BERT) modelCOMMENT
LOW…raining/data_augmentation/train_sts_qqp_crossdomain.py158# Step 3: Train bi-encoder (SBERT) model with QQP dataset - Augmented SBERTCOMMENT
LOW…/training/data_augmentation/train_sts_indomain_bm25.py89# Step 1: Train cross-encoder model with (gold) STS benchmark datasetCOMMENT
LOW…/training/data_augmentation/train_sts_indomain_bm25.py135# Step 2: Label BM25 sampled STSb (silver dataset) using cross-encoder modelCOMMENT
LOW…/training/data_augmentation/train_sts_indomain_bm25.py188# Step 3: Train bi-encoder model with both (gold + silver) STSbenchmark dataset - Augmented SBERTCOMMENT
LOW…ining/data_augmentation/train_sts_indomain_semantic.py101# Step 1: Train cross-encoder model with STSbenchmarkCOMMENT
LOW…ining/data_augmentation/train_sts_indomain_semantic.py140# Step 2: Find silver pairs to labelCOMMENT
LOW…ining/data_augmentation/train_sts_indomain_semantic.py199# Step 3: Train bi-encoder model with both STSbenchmark and labeled AllNlI - Augmented SBERTCOMMENT
Over-Commented Block12 hits · 12 pts
SeverityFileLineSnippetContext
LOWdocs/conf.py1# Configuration file for the Sphinx documentation builder.COMMENT
LOWdocs/sparse_encoder/training_overview.md141 router = Router.for_query_document(COMMENT
LOW…raining/data_augmentation/train_sts_qqp_crossdomain.py141# Step 2: Label QQP train dataset using cross-encoder (BERT) modelCOMMENT
LOW…ransformer/training/distillation/model_quantization.py61 },COMMENT
LOW…transformer/training/multilingual/make_multilingual.py81# If we want, we can limit the maximum sequence length for the modelCOMMENT
LOW…ations/embedding-quantization/semantic_search_faiss.py61 # In the first call we'll provide the `corpus_embeddings` and get the `corpus_index` back, whichCOMMENT
LOW…ions/embedding-quantization/semantic_search_usearch.py61 # In the first call we'll provide the `corpus_embeddings` and get the `corpus_index` back, whichCOMMENT
LOW…ncoder/training/ms_marco/training_ms_marco_plistmle.py101 # lambda_weight = PListMLELambdaWeight(rank_discount_fn=custom_discount)COMMENT
LOWexamples/cross_encoder/training/distillation/README.md61# {"corpus_id": 4, "score": 0.91639173},COMMENT
LOW.github/workflows/sync-skills.yml1name: Sync skill to huggingface/skillsCOMMENT
LOW…train_sentence_transformer_static_embedding_example.py1#!/usr/bin/env python3COMMENT
LOW…cripts/train_sentence_transformer_with_lora_example.py1#!/usr/bin/env python3COMMENT
Slop Phrases2 hits · 6 pts
SeverityFileLineSnippetContext
MEDIUM…te_questions/application_duplicate_questions_mining.py10# For demonstration purposes, we limit it to a few questions which all have on duplicateCOMMENT
MEDIUM…ce_transformer/training/prompts/training_nq_prompts.py26# Feel free to adjust these variables:COMMENT
Fake / Example Data1 hit · 2 pts
SeverityFileLineSnippetContext
LOWtests/base/test_model.py381 SentenceTransformer(modules=[torch.nn.Linear(10, 10)], use_auth_token="fake-token")CODE